中文

看见它还是看不到?基于视觉感知的潜在引导以缓解对象幻觉

计算机视觉与模式识别 2025-05-26 v1 人工智能

摘要

大型视觉语言模型(LVLMs)取得了显著进展,但仍在处理对象幻觉(OH)方面存在挑战,即生成与视觉输入不一致的输出。虽然已有方法旨在减少OH,但导致幻觉的视觉决策机制仍鲜有了解。本文提出VaLSe,一种面向视觉的潜在引导框架,采用解释后缓解策略以应对LVLMs中的OH。通过解决建模复杂视觉语言互动和消除伪激活瑕疵的双重挑战,VaLSe能够生成视觉贡献图,追踪特定视觉输入如何影响 individual 输出标记。这些图表揭示了模型的视觉感知焦点区域,随后用于潜在空间引导,将内部表示重新对齐至语义相关内容,从而减少幻觉输出。广泛实验表明,VaLSe是一种强大的解释工具和提升模型对OH鲁棒性的有效方法,可跨越多个基准测试。此外,我们的分析揭示了现有OH评估指标的局限性,凸显了未来工作中需要更细致、可解释且以视觉为导向的OH基准测试的必要性。代码已公开:https://github.com/Ziwei-Zheng/VaLSe。

关键词

引用

@article{arxiv.2505.17812,
  title  = {Seeing It or Not? Interpretable Vision-aware Latent Steering to Mitigate Object Hallucinations},
  author = {Boxu Chen and Ziwei Zheng and Le Yang and Zeyu Geng and Zhengyu Zhao and Chenhao Lin and Chao Shen},
  journal= {arXiv preprint arXiv:2505.17812},
  year   = {2025}
}