Dolphin-v2:基于可扩展锚定提示的通用文档解析
计算机视觉与模式识别
2026-02-06 v1
摘要
文档解析正在随着视觉语言模型(VLM)OCR能力的提升而广受关注。然而,该领域仍在多个具有不同优势的专用模型之间碎片化,迫使用户不得不进行复杂的模型选择,从而限制了系统的可扩展性。此外,现有的两阶段方法依赖于轴对齐边界框进行布局检测,无法有效处理扭曲或拍摄的文档。为此,我们提出Dolphin-v2,这是一个在原型Dolphin基础上大幅改进的文档图像解析模型。在第一阶段,Dolphin-v2联合执行文档类型分类(数字文档与拍摄文档)和布局分析。对于数字文档,它进行更细致的元素检测并预测阅读顺序。在第二阶段,我们采用混合解析策略:拍摄文档整体作为完整页面进行解析以处理几何扭曲,而数字文档则根据检测到的布局锚点进行元素级并行解析,以实现高效的内容提取。与原型Dolphin相比,Dolphin-v2引入了若干关键性强的改进:(1)通过整体页面理解实现对拍摄文档的稳健解析,(2)进行更细致的元素检测(21类)并提取语义属性如作者信息和文档元数据,(3)识别代码块并保留缩进,这些是现有系统通常缺乏的功能。在DocPTBench、OmniDocBench以及我们自构建的RealDoc-160基准上进行了全面评估。结果表明,在具有挑战性的OmniDocBench上整体提升了14.78分,在拍摄文档上错误率降低91%,同时通过并行处理保持了高效推理。
引用
@article{arxiv.2602.05384,
title = {Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting},
author = {Hao Feng and Wei Shi and Ke Zhang and Xiang Fei and Lei Liao and Dingkang Yang and Yongkun Du and Xuecheng Wu and Jingqun Tang and Yang Liu and Hong Chen and Can Huang},
journal= {arXiv preprint arXiv:2602.05384},
year = {2026}
}