中文

更多思考,更少观察?评估多模态推理模型中放大的幻觉

计算与语言 2025-06-23 v3 人工智能 计算机视觉与模式识别

摘要

测试时计算赋能多模态大语言模型生成扩展的推理链,在多模态数学推理等任务中取得了出色的表现。然而,这种提升的推理能力通常伴随着幻觉的增加:随着生成内容变长,模型倾向于偏离基于图像的内容,并更加依赖语言先验。注意力分析表明,更长的推理链导致对视觉输入的关注减少,从而引发幻觉。为了系统地研究这一现象,我们引入了 RH-AUC,这是一种量化模型感知准确率如何随推理长度变化的指标,使我们能够评估模型在推理过程中是否保持了视觉基础。我们还发布了 RH-Bench,这是一个涵盖各种多模态任务的诊断基准,旨在评估推理能力与幻觉之间的权衡。我们的分析表明,(i)更大的模型通常能在推理和感知之间实现更好的平衡,(ii)这种平衡受训练数据的类型和领域的影响大于受其总量的影响。这些发现强调了联合考虑推理质量和感知保真度的评估框架的重要性。

关键词

引用

@article{arxiv.2505.21523,
  title  = {More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models},
  author = {Chengzhi Liu and Zhongxing Xu and Qingyue Wei and Juncheng Wu and James Zou and Xin Eric Wang and Yuyin Zhou and Sheng Liu},
  journal= {arXiv preprint arXiv:2505.21523},
  year   = {2025}
}