中文

自适应残差更新引导:用于大型视觉语言模型中低开销幻觉缓解的方法

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

大型视觉语言模型(LVLM)通常将视觉输入作为语言解码器的前缀进行处理。当模型自回归生成文本时,这些初始视觉信息不可避免地会经历“稀释”,导致模型过度依赖语言先验并产生对象幻觉。现有的干预措施试图通过对比logits或迭代优化输出来纠正这一点,但它们会带来高昂的延迟成本。我们提出了残差更新引导的解码调节(RUDDER)框架,该框架通过创建一个持久的视觉锚点来对抗视觉稀释。我们直接从模型的预填充残差更新中提取一个稳健的证据方向(CARD),并将其注入解码过程。这种注入由一个自适应门控(Beta门控)调节,该门控充当信任机制,确保仅在必要时应用视觉提醒。在LLaVA-1.5(7B/13B)、Idefics2、InstructBLIP和Qwen2.5-VL上的实验表明,RUDDER持续缓解幻觉(在贪婪解码下,RUDDER相对减少了CHAIR_S平均24.4%和CHAIR_i平均23.6%),并且在不同架构间有效扩展,同时保持>96.0%的吞吐量。

关键词

引用

@article{arxiv.2511.10292,
  title  = {Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models},
  author = {Zhengtao Zou and Ya Gao and Jiarui Guan and Bin Li and Pekka Marttinen},
  journal= {arXiv preprint arXiv:2511.10292},
  year   = {2026}
}

备注

Accepted by ICML 2026; Code available at: https://github.com/Akko000/RUDDER-Residual-Update-Directed-DEcoding-Regulation-