中文

解读与编辑视觉语言表示以缓解幻觉问题

计算机视觉与模式识别 2025-02-12 v2 机器学习

摘要

我们研究了视觉语言模型(VLM)的内部表示,以解决幻觉问题,这一挑战尽管在模型规模和训练方面取得进展,却仍然存在。我们将VLM的内部图像表示投影到其语言词汇表,并观察到对真实物体的输出概率比幻觉物体更为自信。我们 additionally 使用这些输出概率对真实物体进行空间定位。基于这一方法,我们引入一种知识擦除算法,通过对抗幻觉物体特征的线性正交化来消除图像特征,从而消除幻觉。我们展示,针对模型潜在表示进行的定向编辑可在COCO2014数据集上将幻觉减少最高可达25.7%,同时保持性能。我们的发现表明,深入理解VLM的潜在表示如何增强可靠性,并可实现 novel capabilities,如零样本分割。

关键词

引用

@article{arxiv.2410.02762,
  title  = {Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations},
  author = {Nick Jiang and Anish Kachinthaya and Suzie Petryk and Yossi Gandelsman},
  journal= {arXiv preprint arXiv:2410.02762},
  year   = {2025}
}

备注

Accepted to ICLR '25. Project page: http://anishk23733.github.io/vl-interp/. V2 added more experiments in appendix