当今世界前十 OCR 横评:开源、云服务与视觉大模型三派之争

Tesseract / PaddleOCR / Surya / EasyOCR / RapidOCR / Google Document AI / AWS Textract / Azure Document Intelligence / 百度云 / 视觉大模型,10 个方案的定位、强弱与选型建议——以及「识别」正在被「理解」取代的趋势。

  • AI
  • OCR
  • 文字识别
  • Tesseract
  • PaddleOCR
  • 视觉大模型
  • 横评

OCR(光学字符识别)这个领域,这几年被多模态大模型搅得天翻地覆: 一边是开源方案在精度和速度上卷出新高度,一边是视觉大模型把"识别文字"变成了原生能力。 这篇横评选取当今最具代表性的 10 个 OCR 方案,分成三个阵营——开源本地、云服务 API、视觉大模型——每个方案都给出可查证的实时数据: GitHub 星数、版本、语言覆盖、基准分数、价格。文末附按需求选型的对照表。

数据说明:GitHub 星数、版本、模型信息为撰写当日实时抓取;价格为官网公布的刊例价(美元)。基准分数来自各项目官方公布的评测,测试集不同,横向比较仅供参考。

一、阵营总览:10 个方案一张表

方案阵营星数/版本语言覆盖一句话定位
Tesseract开源本地75.8k star,v5100+ 语言服役 40 年的开源常青树
PaddleOCR开源本地87.4k star,PP-OCRv6v6 单模型 50 语言,VL 109 语言中文识别事实王者,文档理解全家桶
EasyOCR开源本地29.9k star,v1.7.280+ 语言上手最简单的 PyTorch OCR
Surya OCR开源本地21.2k star,Surya 290+ 语言(91 实测)版面识别是新强项
RapidOCR开源本地7.4k star中英默认,其余见文档PaddleOCR 模型的轻量 ONNX 部署版
AWS Textract云服务多语言表单/表格/键值对结构提取标杆
Azure Document Intelligence云服务多语言微软文档智能,预置模型最多
Google Document AI云服务多语言Google 全家桶,可定制解析器
百度云 OCR云服务中文专项最全证件/票据专项接口最多的国产云
多模态视觉大模型(Gemini / Qwen-VL / GPT-4o)视觉大模型Qwen3-VL 最大 235B-A22BQwen3-VL 32 语言把 OCR 变成"看图说话"的原生能力

二、开源本地派:免费、可控、数据说话

1. Tesseract —— 40 年的开源常青树

75.8k star,1980 年代诞生于惠普、后来由 Google 主导开发, 当前稳定版是 v5(2021 年 11 月发布 5.0.0)。采用 LSTM 神经网络引擎,开箱即用支持 100+ 语言,是无数项目的默认选择。 输出格式极其丰富:纯文本、hOCR、PDF(含不可见文本层)、TSV、ALTO、PAGE 一应俱全。

:完全免费、无网络依赖、语言覆盖最广、生态最成熟、Apache 2.0 可商用。:官方 README 不公布任何精度基准——对复杂版面、手写体、低清晰度图片吃力, 中文精度与专用方案差距明显。适合:本地批量处理、隐私敏感、对精度要求不极致的场景。

2. PaddleOCR —— 中文识别的实际王者

87.4k star,是这份榜单里 star 数最高的开源 OCR。百度开源, 迭代速度极快,撰写时的最新模型是 PP-OCRv6(PaddleOCR 3.7.0,2026-06 发布): 单模型统一支持 50 种语言(中文、英文、日文 + 46 种拉丁文字), 中档模型 34.5M 参数。官方给出的硬指标:

  • 检测 +4.6%、识别 +5.1%(相对 PP-OCRv5 中档模型);
  • 官方宣称在基准上超过 Qwen3-VL-235B、GPT-5.5
  • CPU 提速 5.2×(OpenVINO)、Apple M4 上 6.1×、A100 GPU 上单张 0.13 秒
  • 多语言模型覆盖 109 语言、仅 2M 参数
  • 旗舰的 PaddleOCR-VL-1.6(视觉语言模型)在 OmniDocBench 上 96.3%(V1.5 为 94.5%)。

还附带版面分析、表格识别、公式识别、印章识别、古籍/生僻字识别,甚至支持 浏览器端推理(PaddleOCR.js)和 MCP server:中文精度顶尖、文档理解全家桶、支持微调、多端部署。:依赖较重,部署比 Tesseract 复杂。

3. EasyOCR —— 十分钟跑起来的入门选择

29.9k star,最新 v1.7.2(2024-09)。基于 PyTorch,支持 80+ 语言,覆盖拉丁、中文、阿拉伯、天城文、西里尔等主要书写系统。 检测用 CRAFT 算法、识别用 CRNN(ResNet/VGG + LSTM + CTC)。 每个结果都带边界框坐标、识别文本和置信度,API 极简。

:上手成本最低、多语言、可训练自定义模型、有 Docker。:官方不公布精度基准,速度偏慢,大图内存吃紧。 适合:快速验证、教学 demo、原型阶段。

4. Surya OCR —— 新一代开源,版面识别是强项

21.2k star,当前主版本 Surya 2:一个约 0.65B 参数的 视觉语言模型,同时承担 OCR、版面分析、阅读顺序、表格识别(91 种语言)。 官方公布了两组硬基准:

  • olmOCR-bench:83.3%,官方称"3B 参数以下最强"—— 对比:Infinity-Parser2-Pro 87.6%(35.1B)、Chandra OCR 2 85.9%(4.0B)、olmOCR 77.4%(8.3B);
  • 多语言总体通过率 87.2%(91 语言),其中 38 种 ≥90%、76 种 ≥80%; Top3:意大利语 93.0%、英语 92.3%、西班牙语 90.7%;
  • 吞吐量:RTX 5090(vllm)5.35 页/秒、12,884 tokens/s;Apple Silicon 0.108 页/秒(约 30W)。

还支持公式识别(输出 KaTeX 兼容 LaTeX)和独立的 OCR 错误检测模型。 注意许可:代码 Apache 2.0,但权重是修改版 OpenRAIL-M—— 年收入 500 万美元以下免费(研究/个人/初创),商用超限需 Datalab 授权。:版面理解出色、有实测基准、低参数量高分。:模型较大吃资源,权重许可有商用限制。

5. RapidOCR —— 轻量部署的实用主义

7.4k star。把 PaddleOCR 的模型转成 ONNX,去掉 Paddle 框架依赖, 换来更小的体积和更简单的部署。支持 ONNX Runtime、OpenVINO、MNN、TensorRT、PyTorch六种推理引擎,Python/C++/Java/C# 都有绑定,可离线部署,全部有 Docker。 默认支持中英文,其余语言见文档。

:部署极简、跨语言、CPU 可跑、精度继承 PaddleOCR、Apache 2.0。:功能是 PaddleOCR 的子集,微调不如原生方便。 适合:要中文精度又要轻量部署的桌面端、边缘端应用。

三、云服务派:精度、结构、省心

6. AWS Textract —— 表单和表格的结构化之王

AWS 的 OCR 服务,最大卖点是结构化提取:把表单里的键值对、表格里的行列、 手写文字抽取成结构化 JSON。官方价格(美西俄勒冈,按页计费,前 1M 页档位):

功能前 1M 页单价1M 页后
Detect Document Text(纯 OCR)$0.0015/页$0.0006/页
Analyze Document – Tables$0.015/页$0.010/页
Analyze Document – Forms$0.05/页$0.04/页
Analyze Document – Signatures$0.0035/页$0.0014/页
Analyze Expense$0.01/页$0.008/页
Analyze ID$0.025/页$0.01/页
Analyze Lending$0.07/页$0.055/页

新用户有 3 个月免费额度(Detect Text 1000 页/月、Forms/Tables 100 页/月、Lending 2000 页/月)。:表单/表格/键值对提取标杆、AWS 生态集成、API 稳定。:结构化功能单价高(Forms 比纯 OCR 贵 30 多倍)、中文支持略逊国产方案。 适合:发票、保险、抵押贷款等"表单密集"业务。

7. Azure AI Document Intelligence —— 预置模型最多的文档智能

前身是 Form Recognizer,免费层(F0)每月 500 页,S0 起按每 1000 页计费。 预置模型覆盖文档、版面、收据、发票、身份证、W-2、1098 税表、健康保险卡、合同等, 自定义分类/提取模型训练前 10 小时免费、之后 $3/小时。 (注:Azure 定价页的价格为动态占位符,实际单价需用官网定价计算器查询。)

:预置文档模型最全、Office 生态集成、自定义训练方便、可容器化部署。:免费层不含 premium 功能、中文专项不如国内云。 适合:企业合规文档、RPA 自动化、微软生态重度用户。

8. Google Document AI —— 全家桶式文档理解

Google 的文档理解服务,分 OCR 处理器(基础文字识别)和表单解析器、自定义提取器(结构化提取)两层,文档解析器可针对自己的 文档类型训练。对 Google 生态(Drive、BigQuery、Vertex AI)的整合是它最大的差异化。

:精度稳定、解析器可定制、和 Google 数据栈无缝、新项目每月有免费配额。:解析器配置有学习曲线、结构化提取单价高。 适合:数据已在 Google Cloud、需要规模化文档处理的团队。

9. 百度云 OCR —— 中文专项最全的一站式

国内云厂商里 OCR 产品线最全的之一:通用文字识别之外,还有身份证、银行卡、 发票、营业执照、行驶证、增值税发票等大量专项识别接口,直接返回结构化字段, 且有免费调用额度、国内访问快。阿里云、腾讯云也有同类产品,以百度为代表。

:中文证件/票据专项最全、开箱即用、有免费额度、国内访问快。:数据要过云厂商,涉密场景要注意;外语识别一般。 适合:国内业务、证件核验、票据自动化。

四、视觉大模型派:OCR 正在被"看图"取代

10. 多模态视觉大模型 —— Gemini / Qwen-VL / GPT-4o

通用视觉大模型的原生 OCR 能力,已经在许多场景追平甚至超过专用 OCR。 它们不"识别"文字,而是"理解"整张图——文字、版面、语义一起消化。 以 Gemini 为例,官方定价(每百万 token,图像输入按文本同价计费):

模型输入(文本/图像)输出
Gemini 2.5 Flash$0.30 / 百万 token$2.50 / 百万 token
Gemini 2.5 Pro$1.25 / 百万 token(≤200k 上下文)$10.00 / 百万 token
Gemini 2.5 Pro Batch$0.625 / 百万 token$5.00 / 百万 token

开源侧,Qwen3-VL(Apache-2.0)提供从 2B 到 235B-A22B(MoE)的完整梯度, 原生 256K 上下文(可扩到 1M),支持 32 种语言的 OCR。GPT-4o 系列也是同价位区间的闭源选择。

:复杂版面(图表、公式、手写、扫描件混排)表现顶级、理解语义、 不用单独调 OCR 服务、能直接输出结构化结果。:大批量时按 token 计费成本失控、延迟高、 对"像素级精确"(如细密表格)偶尔反而出错。 适合:复杂文档、罕见文字、需要语义理解的场景。

五、怎么选:按需求对号入座

你的需求首选关键数据支撑
免费、本地、隐私敏感Tesseract100+ 语言,Apache 2.0
中文为主、要精度PaddleOCRPP-OCRv6,中文全家桶
中文 + 轻量部署RapidOCRONNX 多引擎,CPU 可跑
复杂版面:扫描书、多栏Surya OCRolmOCR-bench 83.3%(<3B 最强)
快速原型 / demoEasyOCR80+ 语言,API 最简
发票、表单、键值对AWS TextractForms $0.05/页,结构提取标杆
预置文档模型最全Azure Document Intelligence9 类预置模型,500 页/月免费
国内证件、票据专项百度云 OCR专项接口最全,免费额度
复杂文档 + 语义理解Gemini / Qwen3-VLFlash $0.30/M token,Qwen3-VL 开源
超大批量、要最便宜开源本地 + 蒸馏边际成本趋近于电费

我的收获

  1. 开源派的内卷已经白热化——PaddleOCR 87.4k star 把中文卷到 OmniDocBench 96.3%, Surya 用 0.65B 参数打出 83.3% olmOCR-bench,还在拼 <3B 参数档位。免费方案的精度已经逼近甚至反超云服务。
  2. 价格结构决定了架构——云 OCR 按页收、视觉大模型按 token 收、开源本地按电费收。 量越大,越该往开源本地挪;这也是很多生产系统最终是"开源识别 + 大模型兜底"混合架构的原因。
  3. 视觉大模型正在改写规则——Gemini 图像输入和文本同价、Qwen3-VL 把 235B 级模型开源, 这让"理解式 OCR"的成本曲线急速下移。专用 OCR 的护城河,正在从"认得准"收缩到"快、稳、便宜、像素级精确"。
  4. OCR 的价值在下游——真正拉开差距的不是谁认得更准,而是谁让结果直接可用: 结构化字段、版面理解、与 RAG/Agent 流水线的衔接。这和站里RAG 那篇是同一件事:识别只是入口,提取和利用才是价值所在。

OCR 把纸面内容变成文本,RAG 把文本变成可检索的知识—— 两篇连起来读,正好是一条完整的"从纸张到知识库"的流水线。