中文

Skip \n:一种减少大型视觉语言模型幻觉的简单方法

计算机视觉与模式识别 2024-05-16 v6 人工智能 计算与语言 机器学习

摘要

大型视觉语言模型(LVLMs)的最新进展展示了其结合人类语言理解视觉信息的卓越能力。尽管取得了这些进展,LVLMs 仍面临多模态幻觉的挑战,例如生成视觉信息中不存在的对象的文本描述。然而,多模态幻觉的根本原因仍未得到充分探索。在本文中,我们提出了一个新的视角,认为 LVLMs 的内在偏差可能是导致幻觉的关键因素。具体来说,我们系统地识别了一种与段落分隔符(\n\n)相关的语义偏移偏差,即训练数据中 '\n\n' 前后的内容经常表现出显著的语义变化。这种模式导致模型推断 '\n\n' 之后的内容应与之前的内容明显不同,且幻觉描述较少,从而增加了在 '\n\n' 之后产生幻觉描述的概率。我们已在多个公开可用的 LVLMs 上验证了这一假设。此外,我们发现故意在生成的描述中插入 '\n\n' 会诱发更多幻觉。我们提出了一种简单的方法,通过跳过 '\n' 的输出来有效减轻 LVLMs 的幻觉。

关键词

引用

@article{arxiv.2402.01345,
  title  = {Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models},
  author = {Zongbo Han and Zechen Bai and Haiyang Mei and Qianli Xu and Changqing Zhang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2402.01345},
  year   = {2024}
}