中文

探讨和缓解预训练视觉语言 (CLIP) 模型中的对象幻觉问题

计算机视觉与模式识别 2024-10-07 v1 人工智能

摘要

大型视觉语言模型 (LVLMs) 取得了令人印象深刻的性能,但研究也指出了这些模型中存在严重的对象幻觉问题。然而,关于这些幻觉来源于模型的哪一部分尚无明确结论。本文对 CLIP 模型中的对象幻觉问题进行深入调查,该模型作为许多最先进视觉语言系统的 backbone。我们揭示了即使在孤立情况下,CLIP 模型也容易出现对象幻觉,这表明幻觉问题并非仅源于视觉和语言模态之间的相互作用。为此,我们提出一种逆证数据增强方法,通过创建多种幻觉问题的负样本来缓解此问题。我们展示了该方法能够有效缓解 CLIP 模型的对象幻觉,我们还表明该增强模型可作为视觉编码器使用,有效缓解了 LVLMs 中的对象幻觉问题。

关键词

引用

@article{arxiv.2410.03176,
  title  = {Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models},
  author = {Yufang Liu and Tao Ji and Changzhi Sun and Yuanbin Wu and Aimin Zhou},
  journal= {arXiv preprint arXiv:2410.03176},
  year   = {2024}
}

备注

EMNLP 2024