新闻中心

实测!DeepSeek最新开源OCR模型,多数场景竟不如百度Paddle

2025-11-11
浏览次数:
返回列表

近日,ocr技术领域迎来了爆发期,各类先进模型层出不穷,如百度的paddleocr-vl、阿里的qwen3-vl、小红书推出的dots-ocr,以及nanonets发布的ocr2等。其中,deepseek发布了题为《deepseek-ocr:基于视觉压缩的大模型长上下文增强方案》的研究论文,并同步开源了其模型权重。

DeepSeek-OCR的核心包含两大部分:一是纯粹的OCR能力,这也是本次实测的重点;二是“上下文光学压缩”(Contexts Optical Compression)技术,该技术有效缓解了大模型在处理长文本时面临的算力瓶颈问题。这项创新让AI在处理视觉信息时更接近人类的记忆机制,可能成为通向下一代智能的关键路径。通过视觉压缩实现“以小博大”,DeepSeek-OCR在长文档处理中实现了精度与效率的新平衡,甚至获得了Andrej Karpathy的高度评价。

在OCR性能方面,DeepSeek-OCR表现亮眼。当压缩比≤10倍时,识别准确率超过95%,几乎无损。在ICDAR 2025数据集上,10倍压缩下准确率达到97.3%,处理速度达8.2页/秒,仅占用4.5GB显存。相较之下,MinerU2.0每页输出约6000+ tokens,速度仅为1.5页/秒,显存消耗高达12.8GB,明显处于劣势。实际应用场景中,该模型处理286页年报表格还原率达95.7%,耗时仅4分钟;论文中的公式识别率达到92.1%,生成的LaTeX代码可直接使用;合同批注关联识别率达到89.5%,比Tesseract高出27个百分点。

接下来进入具体测试环节。由于未进行本地部署,测试采用了Hugging Face平台上由用户khang119966搭建的Gradio演示空间(https://www.php.cn/link/9a2df0715e604dc5b670a2ffcc67dbc7 2.5 Pro)进行LaTeX公式识别对比时所用的案例。当时因DeepSeek尚不支持多模态,未能参与评测,此次正好补全这一空缺。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

例1为中高难度模糊手写公式,数字采用欧洲书写习惯,例如7中间带横线,且有一个8极似6。此前测试中仅Gemini 2.5 Pro成功识别,而DeepSeek-OCR与其他多数模型一样,将模糊的8误判为6,且输出中夹杂一段异常字符串,需手动删除后方可正常解析。百度PaddleOCR同样将8识别为6,未能正确还原。

例2为简单印刷体公式,任务较为基础,DeepSeek-OCR与其他主流模型均能顺利完成识别。

例3涉及多个复杂公式的批量识别,DeepSeek-OCR整体完成尚可,但存在明显瑕疵:中间插入了非预期符号,且缺乏合理换行,影响阅读和后续使用;相比之下,百度PaddleOCR处理得更为整洁规范。

Mistral AI Mistral AI

Mistral AI被称为“欧洲版的OpenAI”,也是目前欧洲最强的 LLM 大模型平台

Mistral AI 182 查看详情 Mistral AI

例4为包含矩阵运算的高阶公式,DeepSeek-OCR表现良好,结构还原准确,LaTeX语法正确。

例5是最高难度的手写混合场景——公式嵌入段落文本中,且手写横线与笔记本原装横线重叠干扰,仅Gemini 2.5 Pro成功识别,DeepSeek-OCR结果较差,未能有效分离内容。此外,在复杂表格识别任务中,DeepSeek-OCR未能准确提取表头信息,而百度PaddleOCR-VL表现出色。值得注意的是,测试过程中使用的HF Space稳定性欠佳,常无法同时加载不同模型的结果,限制了横向对比的完整性。

综合来看,DeepSeek-OCR确实展现了强大的技术潜力和创新价值,尤其在长上下文处理与视觉压缩方面的突破值得肯定。然而就当前OCR任务的实际表现而言,它尚未达到SOTA水平。需要强调的是,这并非否定其优秀——其架构设计理念极具前瞻性——但在上述几个测试实例中,其OCR能力确实略逊于百度PaddleOCR-VL这款参数量仅0.9B的小型模型。

另外,在实际应用中,DeepSeek-OCR将PDF转换为Markdown的速度极为出色,22页文档不到一分钟即可完成,但返回格式为JSON,正文内容冗长,缺乏可视化预览,查阅不便。同时,模型并未对插图进行语义理解,其他功能则基本达标。

以上就是实测!DeepSeek最新开源OCR模型,多数场景竟不如百度Paddle的详细内容,更多请关注其它相关文章!


# 小红  # 小红书有没有网站推广  # 网站建设模板服务热线  # 东莞横沥化工网站建设  # 如何进行网站推广面试  # 甘肃网站推广建设  # 固安短视频营销推广工厂  # seo优化相关文章列表  # 郑州抖音seo优化方法  # 通化网站优化团队建设  # 哪种建站平台seo最好  # 来袭  # 一键  # 最全  # 显存  # 率达到  # deepseek  # 开源  # 文档  # 的是  # 欧洲  # 大模型  # claude  # gpt-4  # 百度  # gpt  # 小红书  # pdf  # ai  # json  # markdown  # js 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 高市盈率是什么意思  solidworks打开IGS文件作图教程  python 如何执行linux命令  路由器上面的power红灯是什么意思  j*a怎么读取char数组  nosql数据库的应用场景有哪些  苹果16哪些型号好  苹果16日发售哪些机型  苹果怎么没出5g手机  苹果16哪些功能好用  学typescript有什么用  华为5g手机怎么选择  夸克学习都有什么课程  市盈率动亏损是什么意思  如何弄坏固态硬盘  如何去掉拍电脑的纹路详细教程  夸克链信有什么用  苹果16都有哪些亮点  j*a数组怎么放字符  怎么在typescript定义集合  怎么确定手机是5g  j*a怎么保存到数组  固态硬盘如何拆除  如何学好typescript  vs如何输入命令行参数  比亚迪秦nfc功能是什么意思  树莓派命令行如何新建文件  如何用dos命令启动u盘  虚拟机服务器如何关机命令  华为5g手机怎么用4g网络  苹果16将会带来哪些升级  光刻机分类有哪些品牌的  单片机怎么定义字符长度  万能表上的power是什么意思  主板如何禁用固态硬盘  征信信誉不好如何恢复 如何修复不良征信方法  苹果16改掉了哪些  如何查看电脑的固态硬盘  电信开通nfc功能是什么意思  满射为什么没有逆映射  智能锁type-c接口是什么  dos命令如何复制目录结构  移动固态硬盘如何使用  区块链的热闹将何去何从?  一尺是多少厘米  怎么打印数组j*a  vivo手机爱奇艺怎么投屏到电视操作步骤  固态硬盘内存如何查找  j*a怎么处理json数组  如何winpe cmd命令 

搜索