目标 grounding 是否真的能减少大型视觉语言模型的幻觉现象?
计算机视觉与模式识别
2024-06-21 v1 计算与语言
摘要
大型视觉语言模型(LVLMs)最近在图像描述和许多图像理解任务(例如视觉问答)方面显著推动了技术进步。然而,LVLMs 常常会 "幻觉",生成提到无法在图像中找到的概念的描述。这些幻觉削弱了 LVLMs 的可信度,并且可能是其普遍采用的主要障碍。最近的工作表明,添加 grounding 目标——即显式地将图像区域或对象与文本片段对齐——可减少 LVLM 幻觉的程度。虽然这一观点看起来很直观,但我们认为,这些减少效果是以有缺陷的评估协议 estabished 的,即 (i) 依赖数据(即 MSCOCO)进行评估,该数据已在 LVLM 训练中被广泛使用,以及 (ii) 通过问答而非开放式描述生成来衡量幻觉。在本工作中,我们提供了对 fine-grained 对象 grounding 对 LVLM 幻觉影响的首次系统性分析,under an more realistic 捕捉 LVLM 在开放生成中幻觉的评估协议。我们的广泛实验覆盖三个基础 LLM,揭示 grounding 目标对开放描述生成中的对象幻觉几乎没有或没有任何影响。
关键词
引用
@article{arxiv.2406.14492,
title = {Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?},
author = {Gregor Geigle and Radu Timofte and Goran Glavaš},
journal= {arXiv preprint arXiv:2406.14492},
year = {2024}
}