DianJin-OCR-R1:通过推理与工具交错的视觉语言模型提升OCR能力
计算机视觉与模式识别
2026-03-09 v3
摘要
近期的视觉语言模型(VLM)的进展使端到端的文件解析和理解成为可能,在多样化的光学字符识别(OCR)任务上实现了强大的性能。然而,VLM容易生成输入图像中不存在的单词,由于过度依赖语言先验。相比之下,传统OCR模型其特定识别任务所定制的架构通常在更细致的视觉感知方面具有更强的表现,同时幻觉更少,但通常缺乏在更具挑战性的情况下所需的上下文语义理解和推理能力。为弥合这一差距,我们提出了DianJin-OCR-R1,一种面向识别的推理增强框架,通过推理与工具交错的范式训练VLM。我们的DianJin-OCR-R1模型首先通过其自身的OCR能力识别输入图像中的内容,然后调用其他专家模型以获取额外结果作为参考。随后,它被引导对图像进行“再次查看”,并比较其自身识别的内容与其他结果,以查找错误或遗漏。最后,它整合所有可用证据以生成更准确的输出。该设计使模型能够学习如何在视觉输入上进行隐式再聚焦,并有效地利用其他专家模型的结果以获得更好的性能。我们在ReST和OmniDocBench上评估了DianJin-OCR-R1模型,其中它持续地超过了其非推理的对手和专家模型,表明了该方法的有效性。
引用
@article{arxiv.2508.13238,
title = {DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model},
author = {Qian Chen and Xianyin Zhang and Lifan Guo and Feng Chen and Chi Zhang},
journal= {arXiv preprint arXiv:2508.13238},
year = {2026}
}