中文

面向大型视觉语言模型的风险感知选择性提示以缓解幻觉

计算与语言 2026-05-28 v1

摘要

基于提示的验证在大型视觉语言模型(LVLMs)中广泛用于缓解幻觉,但其实际效果仍鲜有了解。我们系统研究了两种代表性LVLMs架构和幻觉基准测试,发现其本质是一种具有风险的干预:其纠正程度随输入难度增加,而新引入的错误在不同难度水平上均存在。因此,始终开启提示在困难输入上有帮助,但对较简单的输入几乎没有帮助——且可能造成损害。我们的分析进一步表明,这一行为与保守的输出偏移相关。验证提示将注意力从视觉标记重新分配到指令标记,并在中层引发一种在中性提示控制中不存在的独特熵模式,这表明是指令条件注意力重新分配,而非均匀提升的视觉 grounding。针对这种输入依赖的风险,我们提出了风险感知选择性提示(RSP),一种无需训练的方法,利用预生成的不确定性信号在需要时触发验证。RSP缓解了始终开启提示的性能下降,同时保持了基线性能,并且揭示了有效选择信号随架构而异。

关键词

引用

@article{arxiv.2605.28123,
  title  = {Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models},
  author = {Yuang Huang and Yafeng Zhang and Yu Zilan},
  journal= {arXiv preprint arXiv:2605.28123},
  year   = {2026}
}

备注

7 pages, 1 figures, submitted to ACL ARR 2026 May (EMNLP)