中文

性能提升的幻象:对比解码为何无法缓解多模态大语言模型中的对象幻觉?

计算与语言 2025-10-08 v3 人工智能 计算机视觉与模式识别

摘要

对比解码策略在广泛用于减少多模态大语言模型(MLLMs)中的对象幻觉。这些方法通过构建对比样本来诱发幻觉,然后抑制输出分布中的幻觉。然而,本文表明,这些方法实际上无法有效缓解幻觉问题。观察到的性能提升在 POPE 基准测试上主要由两个误导性因素驱动:(1)对模型输出分布进行粗糙的、单向的调整,(2)自适应的合理性约束,将采样策略简化为贪婪搜索。为进一步阐述这些问题,我们引入一系列虚假的改进方法,并对其性能进行评估。实验结果表明,对比解码中观察到的性能提升与其旨在缓解幻觉的目标完全无关。我们的发现挑战了关于对比解码策略有效性的常见假设,为开发缓解 MLLMs 中幻觉的真正有效解决方案铺平了道路。

关键词

引用

@article{arxiv.2504.10020,
  title  = {The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?},
  author = {Hao Yin and Guangzong Si and Zilei Wang},
  journal= {arXiv preprint arXiv:2504.10020},
  year   = {2025}
}