MM-CoT:探索多模态模型中视觉链式推理能力的基准
计算机视觉与模式识别
2025-12-10 v1 人工智能
摘要
执行链式推理(Chain-of-Thought, CoT)推理能力是多模态模型(MMs)的重要里程碑,使其能够解决复杂的视觉推理问题。然而,一个关键问题仍未解决:这种推理是否真正基于视觉证据且逻辑连贯?现有基准测试强调生成,却忽略了验证,即评估推理链是否在视觉上一致且逻辑有效。为填补这一空白,我们引入MM-CoT,一个专门用于探测多模态模型中链式推理的视觉 grounding 与逻辑连贯性诊断基准。不同于生成自由形式的解释,模型必须选择满足两个正交约束的唯一事件链:(i)视觉一致性,确保所有步骤都锚定在可观察证据上;(ii)逻辑连贯性,确保因果与常识的有效性。对抗性干扰项被设计为违反上述任一约束,从而暴露出不同的推理失败。我们在MM-CoT上评估了领先的视觉语言模型,发现即使是最先进的系统也难以应对,揭示了生成流畅性与真实推理忠诚度之间的显著差距。MM-CoT与现有基准测试表现低相关,证明其衡量的是一种独特的视觉 grounding 与逻辑推理组合。该基准为开发未来模型提供了基础,使其不仅能进行合理推理,更能在视觉世界中进行忠实且连贯的推理。
关键词
引用
@article{arxiv.2512.08228,
title = {MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models},
author = {Jusheng Zhang and Kaitong Cai and Xiaoyang Guo and Sidi Liu and Qinhan Lv and Ruiqi Chen and Jing Yang and Yijia Fan and Xiaofei Sun and Jian Wang and Ziliang Chen and Liang Lin and Keze Wang},
journal= {arXiv preprint arXiv:2512.08228},
year = {2025}
}