中文

MME-CoT:用于评估大型多模态模型中链式思维推理质量、鲁棒性和效率的基准

计算机视觉与模式识别 2025-02-14 v1 人工智能 计算与语言

摘要

链式思维(CoT)已显著提升大型语言模型(LLMs)的推理能力,但其对大型多模态模型(LMMs)的影响仍缺乏系统评估和深入调查。本文引入 MME-CoT,一个专门用于评估 LMMs 链式思维推理性能的基准,涵盖六个领域:数学、科学、OCR、逻辑、时空和通用场景。作为该领域的首个全面研究,我们提出了包括三个新指标的严格评估套件,用于在细粒度水平上评估推理质量、鲁棒性和效率。依托精心挑选的高质量数据和独特的评估策略,我们对当前最先进的 LMMs 进行了深入分析,揭示了若干关键见解:1) 具备反思机制的模型在CoT质量方面表现优异,Kimi k1.5 超越 GPT-4o,显示出最高质量的结果;2) CoT 提示有时会降低 LMMs 在感知密集型任务上的性能,表明可能存在有害的过度思考行为;3)尽管CoT质量较高,具备反思机制的 LMMs 在正常响应和自我纠正阶段都表现出显著的效率低下。我们希望 MME-CoT 能为推进 LMMs 的多模态推理提供基础。项目页面:https://mmecot.github.io/

关键词

引用

@article{arxiv.2502.09621,
  title  = {MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency},
  author = {Dongzhi Jiang and Renrui Zhang and Ziyu Guo and Yanwei Li and Yu Qi and Xinyan Chen and Liuhui Wang and Jianhan Jin and Claire Guo and Shen Yan and Bo Zhang and Chaoyou Fu and Peng Gao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2502.09621},
  year   = {2025}
}

备注

Project Page: https://mmecot.github.io/