中文

OddGridBench:揭示多模态大语言模型在细粒度视觉差异灵敏度方面的不足

计算机视觉与模式识别 2026-03-31 v2

摘要

多模态大语言模型(MLLM)在广泛的视觉语言任务中取得了显著成绩,但其在低层次视觉感知,尤其是检测细粒度视觉差异的能力,仍未得到充分探索且缺乏系统性分析。在本工作中,我们引入OddGridBench,用于评估MLLM的视觉差异灵敏度。OddGridBench包含超过1,400个网格化图像,其中单个元素因颜色、大小、旋转或位置等一个或多个视觉属性而与其他所有元素 differ。实验表明,所有评估的MLLM,包括开源家族如Qwen3-VL与InternVL3.5,以及专有系统如Gemini-2.5-Pro与GPT-5,在视觉差异检测方面的表现远低于人类水平。我们进一步提出OddGrid-GRPO,一种集成课程学习与距离感知奖励的强化学习框架。通过逐步控制训练样本的难度,并在奖励设计中纳入空间邻近约束,OddGrid-GRPO显著提升了模型的细粒度视觉辨别能力。我们希望OddGridBench与OddGrid-GRPO为推动感知锚定与视觉差异灵敏度在多模态智能领域的发展奠定基础。代码与数据集已于https://wwwtttjjj.github.io/OddGridBench/公开。

关键词

引用

@article{arxiv.2603.09326,
  title  = {OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models},
  author = {Tengjin Weng and Wenhao Jiang and Jingyi Wang and Ming Li and Lin Ma and Zhong Ming},
  journal= {arXiv preprint arXiv:2603.09326},
  year   = {2026}
}

备注

accepted by CVPR 2026