MIRAGE:评估多模态大语言模型多模态推理链中的幻觉
计算机视觉与模式识别
2025-06-03 v2 机器学习
摘要
多模态大语言模型 (MLLMs) 中的多模态幻觉限制了 MLLMs 的正确性。然而,多模态幻觉来源多样且成因各异。现有基准无法充分区分感知引起的幻觉和推理引起的幻觉。这一失败构成了一个重大问题,并阻碍了对 MLLMs 内多模态推理失败的诊断。为了解决这个问题,我们提出了 {\dataset} 基准,通过构造 MLLMs 能正确感知输入图像但仍存在推理错误的问题来隔离推理幻觉。{\dataset} 引入了多粒度评估指标:准确率、事实性和用于幻觉量化的 LLMs 幻觉分数。我们的分析表明:(1) 模型规模、数据规模和训练阶段显著影响逻辑幻觉、捏造幻觉和事实幻觉的程度;(2) 当前的 MLLMs 对由误解空间关系引起的空间幻觉没有表现出有效改善,表明其视觉推理能力有限;(3) 问题类型与不同的幻觉模式相关,突出了针对性的挑战和潜在的缓解策略。为了应对这些挑战,我们提出了 {\method},该方法结合了课程强化微调,通过逐步降低学习难度来鼓励模型生成逻辑一致的推理链,并结合协作提示推理以降低推理复杂度。{\method} 在 {\dataset} 上建立了基线,并减少了原始基础模型中的逻辑幻觉。
引用
@article{arxiv.2505.24238,
title = {MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM},
author = {Bowen Dong and Minheng Ni and Zitong Huang and Guanglei Yang and Wangmeng Zuo and Lei Zhang},
journal= {arXiv preprint arXiv:2505.24238},
year = {2025}
}