CoFi-Dec:基于粗到细生成式反馈的 hallucination 抗干扰解码方法在大型视觉语言模型中的应用
计算机视觉与模式识别
2025-12-30 v1 人工智能
摘要
大型视觉语言模型(LVLMs)在多模态理解与生成方面取得了显著进展。然而,它们仍倾向于生成与视觉输入不一致的幻觉内容,这限制了其在实际应用中的可靠性。我们提出了 **CoFi-Dec**,这是一种无训练解码框架,通过集成生成式自反馈和粗到细视觉条件化来缓解幻觉问题。受人类视觉从全局场景感知到详细检查的过程启发,CoFi-Dec 首先在原始图像的粗粒度和细粒度视图条件下生成两个中间文本响应。这些响应随后通过文本到图像模型转换为合成图像,形成多层次视觉假设,丰富了 grounding 线索。为统一来自这些多重视觉条件的预测,我们引入了基于 Wasserstein 距离的融合机制,将它们的预测分布对齐到几何一致的解码轨迹中。这种原则性的融合在高层语义一致性与细粒度视觉 grounding 之间取得了平衡,导致更稳健且忠实于原像素的内容。广泛的实验表明,CoFi-Dec 在六个关注幻觉的基准测试中显著减少了实体级和语义级幻觉,超越了现有的解码策略。该框架具有模型无关性,无需额外训练,可无缝应用于广泛的 LVLMs。实现代码已公开于 https://github.com/AI-Researcher-Team/CoFi-Dec。
引用
@article{arxiv.2512.23453,
title = {CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models},
author = {Zongsheng Cao and Yangfan He and Anran Liu and Jun Xie and Feng Chen and Zepeng Wang},
journal= {arXiv preprint arXiv:2512.23453},
year = {2025}
}