中文

VALOR-EVAL:大型视觉语言模型的全面覆盖度与忠实性评估

计算与语言 2024-10-07 v4 计算机视觉与模式识别

摘要

大型视觉语言模型(LVLMs)存在幻觉问题,即生成听起来合理但事实错误的输出,削弱了其可靠性。需要全面定量评估以识别和理解这些模型中幻觉的范围。然而,现有基准通常范围有限,主要关注对象幻觉。此外,当前评估方法难以有效解决模型输出与参考数据之间细微语义差异,以及幻觉与信息丰富性之间的平衡。为此,本文引入一个多维度基准,覆盖对象、属性和关系,选取基于关联偏见的具有挑战性的图像。此外,我们提出一种基于大型语言模型(LLM)的两阶段评估框架,延续流行的CHAIR指标,并纳入忠实性与覆盖度。我们在10个既定LVLMs上进行实验,结果表明我们的方法在评估我们挑战性的人工标注数据集时,比现有工作更全面且更贴近人类判断。我们的工作还突显了模型输出忠实性与覆盖度之间关键平衡,鼓励未来在保持输出信息丰富性的同时,解决LVLMs的幻觉问题。

关键词

引用

@article{arxiv.2404.13874,
  title  = {VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models},
  author = {Haoyi Qiu and Wenbo Hu and Zi-Yi Dou and Nanyun Peng},
  journal= {arXiv preprint arXiv:2404.13874},
  year   = {2024}
}

备注

ACL 2024 Findings