当今世界前十 OCR 横评:开源、云服务与视觉大模型三派之争
Tesseract / PaddleOCR / Surya / EasyOCR / RapidOCR / Google Document AI / AWS Textract / Azure Document Intelligence / 百度云 / 视觉大模型,10 个方案的定位、强弱与选型建议——以及「识别」正在被「理解」取代的趋势。
OCR(光学字符识别)这个领域,这几年被多模态大模型搅得天翻地覆: 一边是开源方案在精度和速度上卷出新高度,一边是视觉大模型把"识别文字"变成了原生能力。 这篇横评选取当今最具代表性的 10 个 OCR 方案,分成三个阵营——开源本地、云服务 API、视觉大模型——每个方案都给出可查证的实时数据: GitHub 星数、版本、语言覆盖、基准分数、价格。文末附按需求选型的对照表。
数据说明:GitHub 星数、版本、模型信息为撰写当日实时抓取;价格为官网公布的刊例价(美元)。基准分数来自各项目官方公布的评测,测试集不同,横向比较仅供参考。
一、阵营总览:10 个方案一张表
| 方案 | 阵营 | 星数/版本 | 语言覆盖 | 一句话定位 |
|---|---|---|---|---|
| Tesseract | 开源本地 | 75.8k star,v5 | 100+ 语言 | 服役 40 年的开源常青树 |
| PaddleOCR | 开源本地 | 87.4k star,PP-OCRv6 | v6 单模型 50 语言,VL 109 语言 | 中文识别事实王者,文档理解全家桶 |
| EasyOCR | 开源本地 | 29.9k star,v1.7.2 | 80+ 语言 | 上手最简单的 PyTorch OCR |
| Surya OCR | 开源本地 | 21.2k star,Surya 2 | 90+ 语言(91 实测) | 版面识别是新强项 |
| RapidOCR | 开源本地 | 7.4k star | 中英默认,其余见文档 | PaddleOCR 模型的轻量 ONNX 部署版 |
| AWS Textract | 云服务 | — | 多语言 | 表单/表格/键值对结构提取标杆 |
| Azure Document Intelligence | 云服务 | — | 多语言 | 微软文档智能,预置模型最多 |
| Google Document AI | 云服务 | — | 多语言 | Google 全家桶,可定制解析器 |
| 百度云 OCR | 云服务 | — | 中文专项最全 | 证件/票据专项接口最多的国产云 |
| 多模态视觉大模型(Gemini / Qwen-VL / GPT-4o) | 视觉大模型 | Qwen3-VL 最大 235B-A22B | Qwen3-VL 32 语言 | 把 OCR 变成"看图说话"的原生能力 |
二、开源本地派:免费、可控、数据说话
1. Tesseract —— 40 年的开源常青树
75.8k star,1980 年代诞生于惠普、后来由 Google 主导开发, 当前稳定版是 v5(2021 年 11 月发布 5.0.0)。采用 LSTM 神经网络引擎,开箱即用支持 100+ 语言,是无数项目的默认选择。 输出格式极其丰富:纯文本、hOCR、PDF(含不可见文本层)、TSV、ALTO、PAGE 一应俱全。
强:完全免费、无网络依赖、语言覆盖最广、生态最成熟、Apache 2.0 可商用。弱:官方 README 不公布任何精度基准——对复杂版面、手写体、低清晰度图片吃力, 中文精度与专用方案差距明显。适合:本地批量处理、隐私敏感、对精度要求不极致的场景。
2. PaddleOCR —— 中文识别的实际王者
87.4k star,是这份榜单里 star 数最高的开源 OCR。百度开源, 迭代速度极快,撰写时的最新模型是 PP-OCRv6(PaddleOCR 3.7.0,2026-06 发布): 单模型统一支持 50 种语言(中文、英文、日文 + 46 种拉丁文字), 中档模型 34.5M 参数。官方给出的硬指标:
- 检测 +4.6%、识别 +5.1%(相对 PP-OCRv5 中档模型);
- 官方宣称在基准上超过 Qwen3-VL-235B、GPT-5.5;
- CPU 提速 5.2×(OpenVINO)、Apple M4 上 6.1×、A100 GPU 上单张 0.13 秒;
- 多语言模型覆盖 109 语言、仅 2M 参数;
- 旗舰的 PaddleOCR-VL-1.6(视觉语言模型)在 OmniDocBench 上 96.3%(V1.5 为 94.5%)。
还附带版面分析、表格识别、公式识别、印章识别、古籍/生僻字识别,甚至支持 浏览器端推理(PaddleOCR.js)和 MCP server。强:中文精度顶尖、文档理解全家桶、支持微调、多端部署。弱:依赖较重,部署比 Tesseract 复杂。
3. EasyOCR —— 十分钟跑起来的入门选择
29.9k star,最新 v1.7.2(2024-09)。基于 PyTorch,支持 80+ 语言,覆盖拉丁、中文、阿拉伯、天城文、西里尔等主要书写系统。 检测用 CRAFT 算法、识别用 CRNN(ResNet/VGG + LSTM + CTC)。 每个结果都带边界框坐标、识别文本和置信度,API 极简。
强:上手成本最低、多语言、可训练自定义模型、有 Docker。弱:官方不公布精度基准,速度偏慢,大图内存吃紧。 适合:快速验证、教学 demo、原型阶段。
4. Surya OCR —— 新一代开源,版面识别是强项
21.2k star,当前主版本 Surya 2:一个约 0.65B 参数的 视觉语言模型,同时承担 OCR、版面分析、阅读顺序、表格识别(91 种语言)。 官方公布了两组硬基准:
- olmOCR-bench:83.3%,官方称"3B 参数以下最强"—— 对比:Infinity-Parser2-Pro 87.6%(35.1B)、Chandra OCR 2 85.9%(4.0B)、olmOCR 77.4%(8.3B);
- 多语言总体通过率 87.2%(91 语言),其中 38 种 ≥90%、76 种 ≥80%; Top3:意大利语 93.0%、英语 92.3%、西班牙语 90.7%;
- 吞吐量:RTX 5090(vllm)5.35 页/秒、12,884 tokens/s;Apple Silicon 0.108 页/秒(约 30W)。
还支持公式识别(输出 KaTeX 兼容 LaTeX)和独立的 OCR 错误检测模型。 注意许可:代码 Apache 2.0,但权重是修改版 OpenRAIL-M—— 年收入 500 万美元以下免费(研究/个人/初创),商用超限需 Datalab 授权。强:版面理解出色、有实测基准、低参数量高分。弱:模型较大吃资源,权重许可有商用限制。
5. RapidOCR —— 轻量部署的实用主义
7.4k star。把 PaddleOCR 的模型转成 ONNX,去掉 Paddle 框架依赖, 换来更小的体积和更简单的部署。支持 ONNX Runtime、OpenVINO、MNN、TensorRT、PyTorch六种推理引擎,Python/C++/Java/C# 都有绑定,可离线部署,全部有 Docker。 默认支持中英文,其余语言见文档。
强:部署极简、跨语言、CPU 可跑、精度继承 PaddleOCR、Apache 2.0。弱:功能是 PaddleOCR 的子集,微调不如原生方便。 适合:要中文精度又要轻量部署的桌面端、边缘端应用。
三、云服务派:精度、结构、省心
6. AWS Textract —— 表单和表格的结构化之王
AWS 的 OCR 服务,最大卖点是结构化提取:把表单里的键值对、表格里的行列、 手写文字抽取成结构化 JSON。官方价格(美西俄勒冈,按页计费,前 1M 页档位):
| 功能 | 前 1M 页单价 | 1M 页后 |
|---|---|---|
| Detect Document Text(纯 OCR) | $0.0015/页 | $0.0006/页 |
| Analyze Document – Tables | $0.015/页 | $0.010/页 |
| Analyze Document – Forms | $0.05/页 | $0.04/页 |
| Analyze Document – Signatures | $0.0035/页 | $0.0014/页 |
| Analyze Expense | $0.01/页 | $0.008/页 |
| Analyze ID | $0.025/页 | $0.01/页 |
| Analyze Lending | $0.07/页 | $0.055/页 |
新用户有 3 个月免费额度(Detect Text 1000 页/月、Forms/Tables 100 页/月、Lending 2000 页/月)。强:表单/表格/键值对提取标杆、AWS 生态集成、API 稳定。弱:结构化功能单价高(Forms 比纯 OCR 贵 30 多倍)、中文支持略逊国产方案。 适合:发票、保险、抵押贷款等"表单密集"业务。
7. Azure AI Document Intelligence —— 预置模型最多的文档智能
前身是 Form Recognizer,免费层(F0)每月 500 页,S0 起按每 1000 页计费。 预置模型覆盖文档、版面、收据、发票、身份证、W-2、1098 税表、健康保险卡、合同等, 自定义分类/提取模型训练前 10 小时免费、之后 $3/小时。 (注:Azure 定价页的价格为动态占位符,实际单价需用官网定价计算器查询。)
强:预置文档模型最全、Office 生态集成、自定义训练方便、可容器化部署。弱:免费层不含 premium 功能、中文专项不如国内云。 适合:企业合规文档、RPA 自动化、微软生态重度用户。
8. Google Document AI —— 全家桶式文档理解
Google 的文档理解服务,分 OCR 处理器(基础文字识别)和表单解析器、自定义提取器(结构化提取)两层,文档解析器可针对自己的 文档类型训练。对 Google 生态(Drive、BigQuery、Vertex AI)的整合是它最大的差异化。
强:精度稳定、解析器可定制、和 Google 数据栈无缝、新项目每月有免费配额。弱:解析器配置有学习曲线、结构化提取单价高。 适合:数据已在 Google Cloud、需要规模化文档处理的团队。
9. 百度云 OCR —— 中文专项最全的一站式
国内云厂商里 OCR 产品线最全的之一:通用文字识别之外,还有身份证、银行卡、 发票、营业执照、行驶证、增值税发票等大量专项识别接口,直接返回结构化字段, 且有免费调用额度、国内访问快。阿里云、腾讯云也有同类产品,以百度为代表。
强:中文证件/票据专项最全、开箱即用、有免费额度、国内访问快。弱:数据要过云厂商,涉密场景要注意;外语识别一般。 适合:国内业务、证件核验、票据自动化。
四、视觉大模型派:OCR 正在被"看图"取代
10. 多模态视觉大模型 —— Gemini / Qwen-VL / GPT-4o
通用视觉大模型的原生 OCR 能力,已经在许多场景追平甚至超过专用 OCR。 它们不"识别"文字,而是"理解"整张图——文字、版面、语义一起消化。 以 Gemini 为例,官方定价(每百万 token,图像输入按文本同价计费):
| 模型 | 输入(文本/图像) | 输出 |
|---|---|---|
| Gemini 2.5 Flash | $0.30 / 百万 token | $2.50 / 百万 token |
| Gemini 2.5 Pro | $1.25 / 百万 token(≤200k 上下文) | $10.00 / 百万 token |
| Gemini 2.5 Pro Batch | $0.625 / 百万 token | $5.00 / 百万 token |
开源侧,Qwen3-VL(Apache-2.0)提供从 2B 到 235B-A22B(MoE)的完整梯度, 原生 256K 上下文(可扩到 1M),支持 32 种语言的 OCR。GPT-4o 系列也是同价位区间的闭源选择。
强:复杂版面(图表、公式、手写、扫描件混排)表现顶级、理解语义、 不用单独调 OCR 服务、能直接输出结构化结果。弱:大批量时按 token 计费成本失控、延迟高、 对"像素级精确"(如细密表格)偶尔反而出错。 适合:复杂文档、罕见文字、需要语义理解的场景。
五、怎么选:按需求对号入座
| 你的需求 | 首选 | 关键数据支撑 |
|---|---|---|
| 免费、本地、隐私敏感 | Tesseract | 100+ 语言,Apache 2.0 |
| 中文为主、要精度 | PaddleOCR | PP-OCRv6,中文全家桶 |
| 中文 + 轻量部署 | RapidOCR | ONNX 多引擎,CPU 可跑 |
| 复杂版面:扫描书、多栏 | Surya OCR | olmOCR-bench 83.3%(<3B 最强) |
| 快速原型 / demo | EasyOCR | 80+ 语言,API 最简 |
| 发票、表单、键值对 | AWS Textract | Forms $0.05/页,结构提取标杆 |
| 预置文档模型最全 | Azure Document Intelligence | 9 类预置模型,500 页/月免费 |
| 国内证件、票据专项 | 百度云 OCR | 专项接口最全,免费额度 |
| 复杂文档 + 语义理解 | Gemini / Qwen3-VL | Flash $0.30/M token,Qwen3-VL 开源 |
| 超大批量、要最便宜 | 开源本地 + 蒸馏 | 边际成本趋近于电费 |
我的收获
- 开源派的内卷已经白热化——PaddleOCR 87.4k star 把中文卷到 OmniDocBench 96.3%, Surya 用 0.65B 参数打出 83.3% olmOCR-bench,还在拼 <3B 参数档位。免费方案的精度已经逼近甚至反超云服务。
- 价格结构决定了架构——云 OCR 按页收、视觉大模型按 token 收、开源本地按电费收。 量越大,越该往开源本地挪;这也是很多生产系统最终是"开源识别 + 大模型兜底"混合架构的原因。
- 视觉大模型正在改写规则——Gemini 图像输入和文本同价、Qwen3-VL 把 235B 级模型开源, 这让"理解式 OCR"的成本曲线急速下移。专用 OCR 的护城河,正在从"认得准"收缩到"快、稳、便宜、像素级精确"。
- OCR 的价值在下游——真正拉开差距的不是谁认得更准,而是谁让结果直接可用: 结构化字段、版面理解、与 RAG/Agent 流水线的衔接。这和站里RAG 那篇是同一件事:识别只是入口,提取和利用才是价值所在。
OCR 把纸面内容变成文本,RAG 把文本变成可检索的知识—— 两篇连起来读,正好是一条完整的"从纸张到知识库"的流水线。