以毒为药:利用视觉噪声缓解大型视觉语言模型中的物体幻觉
计算机视觉与模式识别
2025-02-24 v2
摘要
大型视觉语言模型(LVM)扩展了大型语言模型(LLM)的视觉感知能力,使其能够处理和解释视觉信息。损害其可靠性的一个主要挑战是物体幻觉,即 LVM 可能会生成看似合理但实际上不准确的信息。我们提出了一种新颖的视觉对抗扰动(VAP)方法来缓解这一幻觉问题。VAP 通过应用经过策略性优化的视觉噪声来缓解 LVM 幻觉,而无需改变基础模型。我们的方法将抑制幻觉表述为一个优化问题,利用对抗策略生成有益的视觉扰动,从而增强模型的事实基础并减少参数知识偏差。大量实验结果表明,我们的方法在 8 个 SOTA LVM 上一致减少了物体幻觉,验证了其在多种评估中的有效性。
引用
@article{arxiv.2501.19164,
title = {Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs},
author = {Kejia Zhang and Keda Tao and Jiasheng Tang and Huan Wang},
journal= {arXiv preprint arXiv:2501.19164},
year = {2025}
}