看见它还是看不到?基于视觉感知的潜在引导以缓解对象幻觉
计算机视觉与模式识别
2025-05-26 v1 人工智能
摘要
大型视觉语言模型(LVLMs)取得了显著进展,但仍在处理对象幻觉(OH)方面存在挑战,即生成与视觉输入不一致的输出。虽然已有方法旨在减少OH,但导致幻觉的视觉决策机制仍鲜有了解。本文提出VaLSe,一种面向视觉的潜在引导框架,采用解释后缓解策略以应对LVLMs中的OH。通过解决建模复杂视觉语言互动和消除伪激活瑕疵的双重挑战,VaLSe能够生成视觉贡献图,追踪特定视觉输入如何影响 individual 输出标记。这些图表揭示了模型的视觉感知焦点区域,随后用于潜在空间引导,将内部表示重新对齐至语义相关内容,从而减少幻觉输出。广泛实验表明,VaLSe是一种强大的解释工具和提升模型对OH鲁棒性的有效方法,可跨越多个基准测试。此外,我们的分析揭示了现有OH评估指标的局限性,凸显了未来工作中需要更细致、可解释且以视觉为导向的OH基准测试的必要性。代码已公开:https://github.com/Ziwei-Zheng/VaLSe。
引用
@article{arxiv.2505.17812,
title = {Seeing It or Not? Interpretable Vision-aware Latent Steering to Mitigate Object Hallucinations},
author = {Boxu Chen and Ziwei Zheng and Le Yang and Zeyu Geng and Zhengyu Zhao and Chenhao Lin and Chao Shen},
journal= {arXiv preprint arXiv:2505.17812},
year = {2025}
}