OCR-推理基准:揭示 MLLM 在复杂文本丰富图像推理中的真实能力
机器学习
2026-05-27 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
近期多模态慢思考系统在各种视觉推理任务中展现出卓越的性能。然而,由于缺乏专门且系统化的基准,其在文本丰富图像推理任务中的能力仍未得到充分研究。为填补这一空白,我们提出 OCR-推理,一个系统评估多模态大语言模型在文本丰富图像推理任务方面的新基准。具体而言,OCR-推理包含 1,069 个人工标注的示例,涵盖 6 项核心推理能力和 18 项实际推理任务,均来自文本丰富的视觉场景。与提供最终答案的现有文本丰富图像理解基准不同,本基准还提供详细的分步推理过程。这一双重标注使我们能够评估模型的最终答案及其推理过程,从而对文本丰富推理能力进行整体评估。通过利用该基准,我们对最新 MLLM 进行了全面评估。我们的结果表明,即便是最先进的 MLLM 在本基准上也表现出显著困难,未有模型在基准上准确率超过 50%,表明文本丰富图像推理的挑战是迫在眼睫需要解决的紧迫问题。该基准和评估脚本已提供于 https://github.com/SCUT-DLVCLab/OCR-Reasoning。
引用
@article{arxiv.2505.17163,
title = {OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning},
author = {Mingxin Huang and Yongxin Shi and Dezhi Peng and Songxuan Lai and Zecheng Xie and Lianwen Jin},
journal= {arXiv preprint arXiv:2505.17163},
year = {2026}
}
备注
ICLR 2026