用于缓解大型视觉语言模型幻觉的预填充阶段干预
计算机视觉与模式识别
2026-04-29 v1 人工智能
摘要
大型视觉语言模型(LVLMs)在视觉-文本理解方面取得了显著进展,但其可靠性受到幻觉的严重破坏,即生成事实上不正确或不一致的回答。虽然最近使用导向向量的研究在减少幻觉方面展现了前景,但一个显著的挑战仍然存在:它们无意中放大了残余幻觉的严重程度。我们将此归因于它们仅关注解码阶段,在该阶段错误以自回归方式累积,并逐渐恶化后续的幻觉输出。为了解决这个问题,我们提出了预填充阶段干预(PTI),这是一种新颖的导向范式,仅在预填充阶段干预一次,在错误累积发生之前增强初始键值(KV)缓存。具体而言,PTI 具有模态感知能力,为视觉和文本表示推导出不同的方向。这种干预是解耦的,将键导向视觉基础对象,并过滤背景噪声的值,从源头纠正易产生幻觉的表示。大量实验证明了 PTI 在缓解幻觉方面的显著性能,及其在多种解码策略、LVLMs 和基准测试上的泛化能力。此外,PTI 与现有的解码阶段方法正交,支持即插即用集成,可进一步提升性能。代码获取地址:https://github.com/huaiyi66/PTI。
引用
@article{arxiv.2604.25642,
title = {Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models},
author = {Chengsheng Zhang and Chenghao Sun and Xinyan Jiang and Wei Li and Xinmei Tian},
journal= {arXiv preprint arXiv:2604.25642},
year = {2026}
}
备注
Accepted by CVPR 2026