中文

定位-稀疏化:基于归因引导的视觉幻觉缓解稀疏策略

计算机视觉与模式识别 2026-05-20 v2 机器学习

摘要

尽管大型视觉语言模型(LVLMs)取得了显著进展,但其生成幻觉的倾向削弱了可靠性并限制了更广泛的实际部署。就幻觉缓解方法而言,特征引导方法是一种在不增加推理成本的情况下减少错误输出的有前景的方法。然而,当前方法在所有层上应用统一的特征引导,这种启发式策略忽略了层间差异,可能干扰与幻觉无关的层,最终导致在通用任务上的性能下降。本文提出了一种用于特征引导的定位-稀疏化框架(LTS-FS),该框架根据每个层的幻觉相关性控制引导强度。我们首先构建了一个包含标记级和句子级幻觉案例的数据集。基于该数据集,我们引入一种基于因果干预的归因方法,用于量化每个层的幻觉相关性。借助跨层的归因得分,我们提出了一种分层策略,将这些得分转换为 individual 层的特征引导强度,实现对幻觉相关层的更精确调整。广泛的实验表明,LTS-FS 在保持强大性能的同时,有效缓解了幻觉问题。代码可在 https://github.com/huttersadan/LTS-FS 访问。

关键词

引用

@article{arxiv.2603.16284,
  title  = {Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation},
  author = {Tiantian Dang and Chao Bi and Shufan Shen and Jinzhe Liu and Qingming Huang and Shuhui Wang},
  journal= {arXiv preprint arXiv:2603.16284},
  year   = {2026}
}

备注

Accepted by CVPR 2026