中文

ABot-OCR 技术报告

计算机视觉与模式识别 2026-05-28 v1

摘要

我们介绍 ABot-OCR,一种端到端视觉语言模型,将页面图像直接转录为干净的 Markdown。通过这种方式,我们的方案完全消除了需要脆弱模块化编排的需求。为最大化解析保真度,我们开发了一个专门的数据引擎,以提供大规模、结构一致的监督。此外,我们提出了解耦异构文档优化,这是一种受结构约束的强化学习方法,超越仅靠监督微调即可锐化文本准确性并严格强制 Markup 良构性。广泛的评估显示,我们的框架性能卓越。在 OmniDocBench v1.5 和 v1.6 基准上,ABot-OCR 在所有端到端系统中均取得了 92.81 和 93.30 的最高分,显著缩小了与强大流水线基准之间的性能差距。最后,针对十种多样化语言的全面多语言文本识别进一步确认了 ABot-OCR 的稳健可迁移性。

关键词

引用

@article{arxiv.2605.27978,
  title  = {ABot-OCR Technical Report},
  author = {Kaitao Jiang and Ruiyan Gong and Xiaolong Cheng and Kangning Niu and Tianlun Li and Mu Xu},
  journal= {arXiv preprint arXiv:2605.27978},
  year   = {2026}
}

备注

21 pages, 11 figures, technical report