VFaith: 大型多模态模型真的是在对所见图像进行推理,而非依赖先前记忆吗?
计算机视觉与模式识别
2025-07-21 v2
摘要
近期大量研究表明,通过引入长链思维(CoT),可以有效增强 MLLMs 解决复杂问题的能力。然而,这类范式有效性的原因尚不清楚。在定量结果上分析模型对视觉线索的特定提取及其后续所谓推理在推理过程中对性能提升的贡献程度是困难的。因此,评估 MLLMs 推理对视觉信息的忠实性至关重要。为解决这一问题,我们首先提出了一种基于 GPT-Image-1 的线索驱动的自动可控编辑流水线。它能够根据指令自动且精确地编辑特定的视觉线索。此外,我们引入了 VFaith-Bench,这是首个用于评估 MLLMs 视觉推理能力并分析此类能力来源的基准,特别强调视觉忠实性。利用所设计的流水线,我们通过改变图像中对解决原始推理问题至关重要的视觉线索,构建了对比问答对,从而改变了问题的答案。通过测试具有不同细节的类似问题图像,平均准确率反映了模型的视觉推理能力,而编辑测试集图像前后准确率的差异则有效揭示了模型推理能力与视觉感知之间的关系。我们进一步设计了特定指标来揭示这种关系。VFaith-Bench 包含 755 个条目,分为五个不同的子集,以及一个额外的人工标注感知任务。我们对现有的主流旗舰模型和突出的开源模型系列/推理模型在 VFaith-Bench 上进行了深入测试和分析,进一步探究其推理能力的潜在因素。
引用
@article{arxiv.2506.11571,
title = {VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?},
author = {Jiachen Yu and Yufei Zhan and Ziheng Wu and Yousong Zhu and Jinqiao Wang and Minghui Qiu},
journal= {arXiv preprint arXiv:2506.11571},
year = {2025}
}