两种原因,绝非一人:重新思考 MLLMs 中的遗漏与制造幻觉
计算机视觉与模式识别
2025-09-03 v1
摘要
多模态大语言模型(MLLMs)取得了显著的进展,但对象幻觉仍然是一个持续的挑战。现有方法基于遗漏与制造幻觉共享共同原因这一错误假设,往往仅减少遗漏,却会引发更多的制造幻觉。本文通过实证表明,遗漏幻觉源于将感知到的视觉特征映射到语言表达时的信心不足,而制造幻觉则源于跨模态表示空间中因训练语料统计偏差而产生的伪关联。基于视觉注意力干预实验的发现,我们提出了视觉-语义注意力势场(Visual-Semantic Attention Potential Field)概念框架,揭示了模型如何构建视觉证据以推断物体的存在或缺失。借助这一洞见,我们引入了视觉势场校准(Visual Potential Field Calibration, VPFC),一种即插即用的幻觉缓解方法,有效减少遗漏幻觉,而不会引入额外的制造幻觉。我们的发现揭示了当前对象幻觉研究中的一个关键疏漏,并为开发更稳健和均衡的幻觉缓解策略指明了新方向。
引用
@article{arxiv.2509.00371,
title = {Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs},
author = {Guangzong Si and Hao Yin and Xianfei Li and Qing Ding and Wenlong Liao and Tao He and Pai Peng},
journal= {arXiv preprint arXiv:2509.00371},
year = {2025}
}
备注
Preprint,Underreview