中文

推理OCR:大型多模态模型能否从OCR线索解决复杂逻辑推理问题?

计算机视觉与模式识别 2025-05-20 v1

摘要

大型多模态模型 (LMM) 正变得越来越多样化,伴随着惊人的光学字符识别 (OCR) 相关能力。现有的 OCR 相关基准侧重于评估 LMM 处理相对简单的视觉问答、视觉-文本解析等能力。然而,LMM 能否处理基于OCR线索的复杂逻辑推理问题尚不为人所知。为此,我们引入了 Reasoning-OCR 基准,这一基准挑战 LMM 基于从丰富视觉-文本中提取的线索解决复杂推理问题。Reasoning-OCR 涵盖六种视觉场景,包含 150 个严谨设计的题目,分为六类推理挑战。此外,Reasoning-OCR 最小化了领域专业知识的影响。我们的评估为不同推理挑战中的专有和开源 LMM 提供了一些见解,凸显了提高基于OCR线索的复杂推理能力的紧迫性。我们希望 Reasoning-OCR 能激发并推动未来研究,以增强基于OCR线索的复杂推理能力。Reasoning-OCR 已公开提供,地址为 https://github.com/Hxyz-123/ReasoningOCR。

关键词

引用

@article{arxiv.2505.12766,
  title  = {Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?},
  author = {Haibin He and Maoyuan Ye and Jing Zhang and Xiantao Cai and Juhua Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2505.12766},
  year   = {2025}
}