中文

面向大型视觉语言模型的动态多模态激活引导:用于幻觉缓解

计算机视觉与模式识别 2026-02-26 v1 人工智能

摘要

大型视觉语言模型(LVLMs)在视觉语言任务上表现突出,但面临幻觉问题。通过对LVLMs激活模式的深入分析,我们发现两个关键发现:1)真实性和视觉感知能力主要涉及模型架构中不同注意力头的子集;2)真实性引导向量在不同语义上下文中差异显著。基于这些观察,我们提出了动态多模态激活引导,这是一种无需训练的幻觉缓解方法。我们的 метод构建了基于语义的真实性引导向量数据库并计算视觉感知引导向量,使其能够在推理期间通过动态选择最相关的引导向量(基于输入语义相似性)并将其应用于最有影响力的注意力头,从而实现上下文感知的干预。我们在多个模型和数据集上进行了全面实验,证明该方法显著提升了模型性能,超越了现有最先进的方法。

关键词

引用

@article{arxiv.2602.21704,
  title  = {Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models},
  author = {Jianghao Yin and Qin Chen and Kedi Chen and Jie Zhou and Xingjiao Wu and Liang He},
  journal= {arXiv preprint arXiv:2602.21704},
  year   = {2026}
}

备注

Accepted by ICLR 2026