中文

Agentar-Fin-OCR

计算机视觉与模式识别 2026-03-12 v1

摘要

本文提出 Agentar-Fin-OCR,一种针对金融领域文档的文档解析系统,将超长金融 PDF 转换为语义一致、高度准确的结构化输出,具备审计级别的数据溯源能力。为解决金融领域的特定挑战,如复杂版面布局、跨页结构中断和单元格级引用能力,Agentar-Fin-OCR 结合了 (1) 跨页内容整合算法以恢复跨页的连续性,以及 Document-level Heading Hierarchy Reconstruction(DHR)模块以构建全局一致的目录(TOC)树,用于结构化检索;以及 (2) 用于表格解析的难度自适应课程学习训练策略,联合 CellBBoxRegressor 模块,该模块使用结构锚定标记从解码器隐藏状态中定位表格单元格,而无需外部检测器。实验表明,我们的模型在 OmniDocBench 的表格解析指标上表现优异。为实现金融领域的真实评估,我们进一步引入 FinDocBench,一个包含六类金融文档类别的基准,包含专家验证的注释和评估指标,包括目录编辑距离相似性(TocEDS)、跨页拼接 TEDS,以及表格单元格交并比(C-IoU)。我们对 FinDocBench 上广泛的先进模型进行评估,以评估其在金融文档上的能力及其局限性。总体而言,Agentar-Fin-OCR 和 FinDocBench 为可靠的下游金融文档应用提供了实用基础。

关键词

引用

@article{arxiv.2603.11044,
  title  = {Agentar-Fin-OCR},
  author = {Siyi Qian and Xiongfei Bai and Bingtao Fu and Yichen Lu and Gaoyang Zhang and Xudong Yang and Peng Zhang},
  journal= {arXiv preprint arXiv:2603.11044},
  year   = {2026}
}