中文

分析与缓解大型视觉-语言模型中的物体幻觉

机器学习 2024-03-19 v2 计算与语言 计算机视觉与模式识别

摘要

大型视觉-语言模型(LVLMs)已展现出以人类语言理解视觉信息的卓越能力。然而,LVLMs 仍受物体幻觉困扰,即生成的描述包含图像中实际不存在的物体。这会对许多视觉-语言任务产生负面影响,例如视觉摘要与推理。为解决此问题,我们提出一种简单而强大的算法——LVLM 幻觉修订器(LURE),通过重构较少幻觉的描述来对 LVLMs 中的物体幻觉进行事后纠正。LURE 建立在对物体幻觉潜在关键因素严谨的统计分析之上,包括共现(某些物体频繁与图像中其他物体一同出现)、不确定性(LVLM 解码过程中具有较高不确定性的物体)以及物体位置(幻觉常出现在生成文本的后续部分)。LURE 也可无缝集成于任意 LVLMs。我们在六个开源 LVLMs 上评估 LURE,在通用物体幻觉评测指标上相较先前最佳方法取得 23% 的提升。在 GPT 和人工评估中,LURE 均持续位列第一。我们的数据与代码可在 https://github.com/YiyangZhou/LURE 获取。

关键词

引用

@article{arxiv.2310.00754,
  title  = {Analyzing and Mitigating Object Hallucination in Large Vision-Language Models},
  author = {Yiyang Zhou and Chenhang Cui and Jaehong Yoon and Linjun Zhang and Zhun Deng and Chelsea Finn and Mohit Bansal and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2310.00754},
  year   = {2024}
}

备注

Accepted by ICLR 2024