Dolphin:基于异构锚定提示的文档图像解析
计算机视觉与模式识别
2025-05-21 v1
摘要
文档图像解析因其复杂交织的元素(如文本段落、图形、公式和表格)而具有挑战性。现有方法要么构建专门的专家模型,要么直接自回归生成页面级内容,尽管性能尚可,但面临集成开销、效率瓶颈和布局结构退化问题。为此,本文提出了 \textit{Dolphin} (\textit{\textbf{Do}cument Image \textbf{P}arsing via \textbf{H}eterogeneous Anchor Prompt\textbf{in}g})——一种遵循分析-解析范式的新型多模态文档图像解析模型。在第一个阶段,Dolphin 生成阅读顺序中的布局元素序列。这些异构元素作为锚点,结合任务特定的提示,再输入 Dolphin 进行并行内容解析。在第二个阶段。为训练 Dolphin,我们构建了一个覆盖多粒度解析任务的大型数据集,包含超过 3000 万样本。通过对常用基准和自构建基准的全面评估,Dolphin 在 diverse 的页面级和元素级设置下均实现了最先进的性能,同时通过轻量级架构和并行解析机制确保了卓越的效率。代码和预训练模型已公开于 https://github.com/ByteDance/Dolphin。
引用
@article{arxiv.2505.14059,
title = {Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting},
author = {Hao Feng and Shu Wei and Xiang Fei and Wei Shi and Yingdong Han and Lei Liao and Jinghui Lu and Binghong Wu and Qi Liu and Chunhui Lin and Jingqun Tang and Hao Liu and Can Huang},
journal= {arXiv preprint arXiv:2505.14059},
year = {2025}
}
备注
Accepted to ACL 2025