在不降低性能的前提下缓解大型视觉语言模型中的幻觉
计算机视觉与模式识别
2026-04-23 v1
摘要
大型视觉语言模型(LVLM)展现出强大的生成能力,但经常产生幻觉,损害输出的可靠性。在无幻觉的标注数据上进行微调提供了最直接的解决方案,但其高昂的计算成本催生了近期基于表示的方法,这些方法专注于减轻隐藏表示中的幻觉成分。尽管高效,我们通过实验观察到,由于幻觉成分提取不完全以及参数更新缺乏选择性,这些方法会降低通用生成能力。为解决这些局限性,我们提出了 MPD,一个在不降低性能的前提下缓解幻觉的双阶段框架。具体而言,我们的 MPD 依赖于两个关键因素:(1)语义感知的成分解耦,以提取纯粹的幻觉成分;(2)可解释的参数更新,选择性地修改与幻觉最相关的参数。大量实验表明,MPD 达到了最先进的性能,在 LLaVA-Bench 和 MME 上的评估显示,幻觉减少了 23.4%,同时保持了 97.4% 的通用生成能力,且没有额外的计算成本。
引用
@article{arxiv.2604.20366,
title = {Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation},
author = {Xingyu Zhu and Junfeng Fang and Shuo Wang and Beier Zhu and Zhicai Wang and Yonghui Yang and Xiangnan He},
journal= {arXiv preprint arXiv:2604.20366},
year = {2026}
}
备注
ACL 2026 (Oral)