分解与比较一致性:通过任务分解一致性比较衡量视觉语言模型的答案可靠性
计算机视觉与模式识别
2024-10-10 v3 计算与语言
摘要
尽管取得了显著进展,当前最先进的视觉语言模型(VLMs)仍远不完美。它们倾向于幻觉并可能生成偏见性响应。在这种情况下,评估给定响应可靠性的方法非常有用。现有方法,如估计答案概率或基于提示的置信度生成,常常表现为过度自信。其他方法使用自我一致性比较,但受确认偏差影响。为缓解这些问题,我们提出了分解与比较一致性(DeCC)用于可靠性测量。通过比较使用VLMs内部推理过程生成的直接答案与通过分解问题为子问题并对由VLMs生成的子答案进行推理所得的间接答案,DeCC衡量了VLMs直接答案的可靠性。在六个视觉语言任务中使用三个VLMs的实验表明,DeCC的可靠性估计与任务准确率之间的相关性优于现有方法。
引用
@article{arxiv.2407.07840,
title = {Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison},
author = {Qian Yang and Weixiang Yan and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2407.07840},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main Conference