面向 grounding 视觉推理的多模态认知评估:MagiC基准
计算机视觉与模式识别
2025-07-11 v1
摘要
近期大型视觉语言模型的进展在视觉问答和多模态推理方面取得了令人印象深刻的性能,但是否真正实现了以 grounding 视觉推理,或仅依赖于浅层模式和数据偏差,仍不明确。本文引入 MagiC,一个全面评估 grounding 多模态认知的基准,评估不仅关注答案准确性,还关注逐步推理质量及其与相关视觉证据的一致性。基准包含约 5,500 个弱监督 QA 示例(源自强模型输出),以及 900 个人类精心挑选的示例,包含详细注释,包括答案、推理过程和边界框 grounding。我们评估了 15 个参数规模从 7B 到 70B 的视觉语言模型,评估维度包括:最终答案正确性、推理有效性、grounding 忠实性和自我纠错能力。MagiC 还包括诊断设置,以探测模型在对抗视觉线索下的鲁棒性,并评估其自省式纠错能力。我们引入新的指标,如 MagiScore 和 StepSense,并提供全面分析,揭示当前 grounding 视觉推理方法的关键局限性和机遇。
关键词
引用
@article{arxiv.2507.07297,
title = {MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning},
author = {Chengfei Wu and Ronald Seoh and Bingxuan Li and Liqiang Zhang and Fengrong Han and Dan Goldwasser},
journal= {arXiv preprint arXiv:2507.07297},
year = {2025}
}