中文

借助反事实图像抑制幻觉:面向LVLM幻觉抑制的扩散引导扰动

计算机视觉与模式识别 2026-03-12 v1

摘要

虽然大型视觉语言模型(LVLMs)在多模态任务上取得了优异性能,但经常会生成幻觉——即与视觉输入不符的错误输出。为此,我们提出CIPHER(Counterfactual Image Perturbations for Hallucination Extraction and Removal),一种通过轻量特征级纠正抑制视觉引发幻觉的无训练方法。不同于先前无训练方法主要关注文本引发幻觉,CIPHER显式针对源于视觉模态的幻觉。CIPHER包含两个阶段。在离线阶段,我们构建OHC-25K(Object-Hallucinated Counterfactuals),由扩散模型生成的人工反事实图像数据集(25,000样本),这些图像刻意与原始 ground-truth 描述相矛盾。我们将这些编辑后的图像与未变的 ground-truth 描述一起输入LVM,从而提取幻觉相关的表示。将这些表示与真实(图像、描述)配对的表示进行对比,揭示了结构化、系统性的偏移,跨越一个揭示视觉引发幻觉的低秩子空间。在推理阶段,CIPHER通过将中间隐藏状态投影远离该子空间来抑制幻觉。跨多个基准的实验表明,CIPHER显著降低了幻觉率,同时保持了任务性能,证明了反事实视觉扰动用于提升LVM忠实性的有效性。代码和附加材料可在 https://hamidreza-dastmalchi.github.io/cipher-cvpr2026/ 获取。

关键词

引用

@article{arxiv.2603.10470,
  title  = {Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression},
  author = {Hamidreza Dastmalchi and Aijun An and Ali Cheraghian and Hamed Barzamini},
  journal= {arXiv preprint arXiv:2603.10470},
  year   = {2026}
}

备注

CVPR 2026