通过图像引导头部抑制消除视觉语言模型中的幻觉
计算机视觉与模式识别
2025-10-17 v2 机器学习
摘要
尽管在多模态理解任务中取得了显著进展,大型视觉语言模型(LVLMs)常常会出现“幻觉”,即生成与视觉上下文不一致的文本。现有方法通过推理时干预来减少幻觉,却会显著增加延迟。为缓解此问题,本文提出SPIN(Spin),一种任务无关的注意力引导头部抑制策略,可在推理期间无缝集成,无需产生显著的计算或延迟开销。我们研究幻觉是否可归因于特定模型组件。我们的分析表明,幻觉可归因于每个图层中动态变化的注意力头部子集。基于此洞察,针对每个文本查询标记,我们选择性抑制注意力值对图像标记较低的注意力头部,保留顶部-K个注意力头部。针对视觉问答和图像描述任务进行大规模评估,结果表明SPIN在降低幻觉得分最高可达2.7倍的同时保持F1分数,并在与现有方法相比下吞吐量提升1.8倍。代码已公开于 https://github.com/YUECHE77/SPIN。
引用
@article{arxiv.2505.16411,
title = {Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression},
author = {Sreetama Sarkar and Yue Che and Alex Gavin and Peter A. Beerel and Souvik Kundu},
journal= {arXiv preprint arXiv:2505.16411},
year = {2025}
}