中文

MiCEval:通过图像描述和推理步骤揭示多模态链式思考的质量

计算与语言 2025-03-03 v4

摘要

多模态链式思考 (MCoT) 是提高多模态大语言模型 (MLLM) 在各种复杂推理任务中性能的流行提示策略。尽管其受欢迎,但缺乏用于评估 MCoT 推理步骤质量的自动化方法。为填补这一空白,我们提出一种多模态链式思考评估框架 (MiCEval),用于评估推理链的正确性,通过评估描述和每个推理步骤的质量来实现。描述组件的评估侧重于图像描述的准确性,而推理步骤则评估每个步骤的质量,该步骤基于前述步骤的条件生成。MiCEval 基于具有细粒度注释的数据集构建,注释按正确性、相关性和信息丰富性对每个步骤进行评级。针对四个最先进的 MLLM 进行大规模实验表明,使用 MiCEval 的逐步骤评估与基于余弦相似度或微调方法的人类判断更吻合。MiCEval 数据集和代码可在 https://github.com/alenai97/MiCEval 查找。

关键词

引用

@article{arxiv.2410.14668,
  title  = {MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps},
  author = {Xiongtao Zhou and Jie He and Lanyu Chen and Jingyu Li and Haojing Chen and Víctor Gutiérrez-Basulto and Jeff Z. Pan and Hanjie Chen},
  journal= {arXiv preprint arXiv:2410.14668},
  year   = {2025}
}

备注

NAACL 2025