中文

FaithScore:面向大型视觉-语言模型幻觉的细粒度评估

计算机视觉与模式识别 2024-09-30 v2

摘要

我们提出 FaithScore(原子图像事实忠实度得分,Faithfulness to Atomic Image Facts Score),一种无参考且细粒度的评估指标,用于衡量大型视觉-语言模型(LVLMs)生成的自由形式回答的忠实度。FaithScore 评估首先识别包含需要验证的描述性陈述的子句,然后从这些子句提取全面的原子事实列表,最后在细粒度原子事实与输入图像之间进行一致性验证。元评估表明我们的指标与人工忠实度判断高度相关。我们收集了两个基准数据集(即 LLaVA-1k 和 MSCOCO-Cap)用于评估 LVLMs 的指令跟随幻觉。我们使用 FaithScore 在数据集上测量最先进 LVLMs 的幻觉。结果揭示当前系统易于生成不忠实于图像的幻觉内容,这为未来改进留下了空间。我们希望我们的指标 FaithScore 能帮助评估未来 LVLMs 的忠实度,并为提升 LVLMs 的忠实度提供有见地的建议。

关键词

引用

@article{arxiv.2311.01477,
  title  = {FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models},
  author = {Liqiang Jing and Ruosen Li and Yunmo Chen and Xinya Du},
  journal= {arXiv preprint arXiv:2311.01477},
  year   = {2024}
}

备注

Accepted by Findings of EMNLP 2024