中文

RotBench:评估多模态大语言模型识别图像旋转能力的基准

计算机视觉与模式识别 2026-01-27 v3 人工智能 计算与语言

摘要

我们研究了多模态大语言模型(MLLMs)准确识别输入图像旋转方向(0{\deg}、90{\deg}、180{\deg} 和 270{\deg})的能力。该任务需要模型具备稳健的视觉推理能力,以检测图像中的旋转线索并在不同方向下正确理解空间关系。为评估 MLLMs 在此方面的能力,我们引入 RotBench—a 一个包含 350 张经人工筛选后图像的数据集,涵盖生活方式、人像和风景图像类型。尽管该任务相对简单,我们展示了包括 GPT-5、o3 和 Gemini-2.5-Pro 在内的多个最先进的开源和专有 MLLMs,无法可靠地识别图像旋转。提供模型额外信息——包括标题、深度图等——或使用链式思考提示仅能带来有限且不稳定的改进。我们的结果表明,大多数模型能够可靠地识别正向(0{\deg})图像,而某些模型能够可靠地识别逆向(180{\deg})图像。但 none 能可靠区分 90{\deg} 和 270{\deg} 旋转的图像。同时呈现不同方向旋转后的图像会为推理类模型带来适度的性能提升,而采用投票机制的修改方案则能改善弱模型的表现。我们进一步表明,微调并未提升模型区分 90{\deg} 和 270{\deg} 旋转的能力,尽管显著提升了对 180{\deg} 图像的识别。综上,这些结果揭示了 MLLMs 在识别旋转方面的空间推理能力与人类感知能力之间存在显著差距。

关键词

引用

@article{arxiv.2508.13968,
  title  = {RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation},
  author = {Tianyi Niu and Jaemin Cho and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2508.13968},
  year   = {2026}
}

备注

EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench