中文

CAI:用于缓解大型视觉语言模型中对象幻觉的描述敏感注意力干预

计算机视觉与模式识别 2025-07-01 v1

摘要

尽管大型视觉语言模型(LVLMs)在解释视觉信息方面展现出强大的能力,但它们经常会产生偏离视觉信息的内容,导致对象幻觉。为解决这一问题,最近的研究要么依赖昂贵的手动标注和训练成本,要么显著增加推理时间。在本工作中,我们观察到,当回答描述查询时,LVLMs对视觉信息的注意力显著强于非描述查询。基于这一现象,我们提出了描述敏感注意力干预(Caption-sensitive Attention Intervention, CAI),这是一种无需训练、即插即用的数据驱动方法,利用对描述查询的注意力激活模式来增强LVLMs的视觉感知能力。跨四个覆盖判别性和生成性任务的基准进行的广泛实验结果表明,CAI仅需最小的额外推理成本,即可实现状态最佳(SOTA)的幻觉缓解性能。

关键词

引用

@article{arxiv.2506.23590,
  title  = {CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models},
  author = {Qiming Li and Zekai Ye and Xiaocheng Feng and Weihong Zhong and Libo Qin and Ruihan Chen and Baohang Li and Kui Jiang and Yaowei Wang and Ting Liu and Bing Qin},
  journal= {arXiv preprint arXiv:2506.23590},
  year   = {2025}
}