查看: 105|回复: 0

阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

62

主题

0

回帖

186

积分

注册会员

积分
186
发表于 2026-7-24 14:25:11 来自手机 | 显示全部楼层 |阅读模式
AI总结
AI总结中
7月24日,阿里巴巴宣布开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在权威文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型,标志着文档智能技术领域迎来突破性范式转折。



作为RAG检索、智能问答与企业知识库的核心基础设施,文档解析长期由“版面分析+内容识别”的流水线串联模式主导,面临维护成本高、误差逐级累积及部署复杂等瓶颈。基于Qwen3.5-0.8B后训练的OvisOCR2突破了上述限制,仅凭单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的Markdown表示。

在技术实现上,模型结合真实与合成数据互补的技术路径,并通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四大手段充分释放紧凑模型的潜力。

目前,OvisOCR2已基于Apache2.0协议在Hugging Face及魔搭社区全面开源,兼容vLLM等主流推理框架,可无缝无感接入千问生态。凭借小参数高效能的部署优势,该模型的推出大幅降低了高精度文档解析的显存与算力门槛,推动文档智能从复杂的系统工程向更简洁的高效模型驱动演进。

Source URL: https://news.aibase.com/zh/news/29866
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部