LogicOCR:大型多模态模型在文本丰富图像上的逻辑推理能力如何?
计算机视觉与模式识别
2025-11-27 v2 计算与语言
摘要
近期大型多模态模型(LMM)的进展在推理和光学字符识别(OCR)方面取得了显著成果。然而,这些模型在文本丰富图像上的复杂逻辑推理能力仍未得到充分探索。为填补这一空白,我们引入 LogicOCR—a 一个包含 2780 个问题的基准测试,包含两个子集:LogicOCR-Gen 包含 1100 个针对生成图像的多选题,LogicOCR-Real 包含 1680 个针对真实世界图像的精心设计的自由形式问题。在构建 LogicOCR-Gen 时,我们首先从中国国家公务员考试语料库中筛选文本语料库,并自定义自动化管道引导 GPT-Image-1 生成具有不同布局和字体的图像,确保语境相关性和视觉真实性。随后,对生成的图像进行人工核查。我们评估了一系列代表性 LMM 在链式思考(CoT)和直接作答设置下的表现。我们的多维分析揭示了关键发现,如测试时扩展、输入模态差异以及对视觉-文本方向的敏感性。值得注意的是,LMM 在多模态推理方面仍落后于文本-only 输入,表明它们尚未完全将视觉阅读与推理结合起来。此外,我们提出了 TextCue—a 一种无需训练的方法,用于增强 LMM 对包含解决问题关键文本线索的图像区域的感知。我们利用 LMM 的注意力图和一个即插即用的文本分割专家来确定该区域,然后对该区域进行裁剪和放大以增强原始图像。实验表明其有效性,例如在 CoT 设置下,LLaVA-OV-1.5-8B 的准确率提升了 1.8%。本基准测试可在 https://github.com/MiliLab/LogicOCR 查阅。
引用
@article{arxiv.2505.12307,
title = {LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?},
author = {Maoyuan Ye and Haibin He and Qihuang Zhong and Jing Zhang and Juhua Liu and Bo Du},
journal= {arXiv preprint arXiv:2505.12307},
year = {2025}
}
备注
GitHub: https://github.com/MiliLab/LogicOCR