图像 Token 很重要:通过潜在表示编辑缓解基于离散 Tokenizer 的大型视觉语言模型中的幻觉
计算机视觉与模式识别
2025-05-29 v1 人工智能
摘要
带有离散图像 tokenizer 的大型视觉语言模型(LVLM)通过将视觉输入编码为有限的 token 集合来统一多模态表示。尽管它们很有效,我们发现这些模型仍然会幻觉出不存在的物体。我们假设这可能是由于训练期间引入的视觉先验造成的:当某些图像 token 频繁在同一空间区域共现并代表共享物体时,它们会与这些物体的语言表达产生强烈的关联。因此,模型可能会通过唤起经常与现有 token 共现但视觉上缺失的 token 来产生幻觉。为了验证这一假设,我们使用分割数据集构建了图像 token 的共现图,并采用图神经网络(GNN)结合对比学习以及聚类方法,将频繁在相似视觉语境中共现的 token 进行分组。我们发现,幻觉主要对应于其 token 主导输入的簇,更具体地说,与图像中存在的 token 相比,这些簇中视觉上缺失的 token 与幻觉物体表现出更高的相关性。基于这一观察,我们提出了一种幻觉缓解方法,通过在生成过程中修改潜在图像嵌入来抑制视觉上缺失 token 的影响。实验表明,我们的方法在保持表达能力的同时减少了幻觉。代码可在 https://github.com/weixingW/CGC-VTD/tree/main 获取。
引用
@article{arxiv.2505.21547,
title = {Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing},
author = {Weixing Wang and Zifeng Ding and Jindong Gu and Rui Cao and Christoph Meinel and Gerard de Melo and Haojin Yang},
journal= {arXiv preprint arXiv:2505.21547},
year = {2025}
}