中文

目标 grounding 是否真的能减少大型视觉语言模型的幻觉现象?

计算机视觉与模式识别 2024-06-21 v1 计算与语言

摘要

大型视觉语言模型(LVLMs)最近在图像描述和许多图像理解任务(例如视觉问答)方面显著推动了技术进步。然而,LVLMs 常常会 "幻觉",生成提到无法在图像中找到的概念的描述。这些幻觉削弱了 LVLMs 的可信度,并且可能是其普遍采用的主要障碍。最近的工作表明,添加 grounding 目标——即显式地将图像区域或对象与文本片段对齐——可减少 LVLM 幻觉的程度。虽然这一观点看起来很直观,但我们认为,这些减少效果是以有缺陷的评估协议 estabished 的,即 (i) 依赖数据(即 MSCOCO)进行评估,该数据已在 LVLM 训练中被广泛使用,以及 (ii) 通过问答而非开放式描述生成来衡量幻觉。在本工作中,我们提供了对 fine-grained 对象 grounding 对 LVLM 幻觉影响的首次系统性分析,under an more realistic 捕捉 LVLM 在开放生成中幻觉的评估协议。我们的广泛实验覆盖三个基础 LLM,揭示 grounding 目标对开放描述生成中的对象幻觉几乎没有或没有任何影响。

关键词

引用

@article{arxiv.2406.14492,
  title  = {Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?},
  author = {Gregor Geigle and Radu Timofte and Goran Glavaš},
  journal= {arXiv preprint arXiv:2406.14492},
  year   = {2024}
}