FaithScore:面向大型视觉-语言模型幻觉的细粒度评估
计算机视觉与模式识别
2024-09-30 v2
摘要
我们提出 FaithScore(原子图像事实忠实度得分,Faithfulness to Atomic Image Facts Score),一种无参考且细粒度的评估指标,用于衡量大型视觉-语言模型(LVLMs)生成的自由形式回答的忠实度。FaithScore 评估首先识别包含需要验证的描述性陈述的子句,然后从这些子句提取全面的原子事实列表,最后在细粒度原子事实与输入图像之间进行一致性验证。元评估表明我们的指标与人工忠实度判断高度相关。我们收集了两个基准数据集(即 LLaVA-1k 和 MSCOCO-Cap)用于评估 LVLMs 的指令跟随幻觉。我们使用 FaithScore 在数据集上测量最先进 LVLMs 的幻觉。结果揭示当前系统易于生成不忠实于图像的幻觉内容,这为未来改进留下了空间。我们希望我们的指标 FaithScore 能帮助评估未来 LVLMs 的忠实度,并为提升 LVLMs 的忠实度提供有见地的建议。
引用
@article{arxiv.2311.01477,
title = {FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models},
author = {Liqiang Jing and Ruosen Li and Yunmo Chen and Xinya Du},
journal= {arXiv preprint arXiv:2311.01477},
year = {2024}
}
备注
Accepted by Findings of EMNLP 2024