中文

评估与分析大型视觉语言模型中的关系幻觉

计算机视觉与模式识别 2024-07-19 v4

摘要

幻觉是当前大型视觉语言模型(Large Vision-Language Models, LVLS)中普遍关注的议题。以往的努力主要聚焦于探讨对象幻觉,这类幻觉可以通过引入目标检测器来缓解。然而,这些努力忽略了对象间关系幻觉的研究,而这种关系是视觉理解的关键。本文引入了 R-Bench,这是一个用于评估视觉关系幻觉的新基准。R-Bench 包含聚焦于关系是否存在的图像级问题,以及评估局部视觉理解的实例级问题。我们识别了导致幻觉的三类关系共现类型:关系-关系、主体-关系和关系-对象。视觉指令调优数据集的长尾分布显著影响 LVLS 对视觉关系的理解。此外,我们的分析揭示,当前 LVLS 倾向于忽视视觉内容,过度依赖大型语言模型的常识知识,同时在基于上下文信息推理空间关系时表现不足。

关键词

引用

@article{arxiv.2406.16449,
  title  = {Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models},
  author = {Mingrui Wu and Jiayi Ji and Oucheng Huang and Jiale Li and Yuhang Wu and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2406.16449},
  year   = {2024}
}

备注

ICML2024; Project Page:https://github.com/mrwu-mac/R-Bench