中文

关注人类分歧中的不确定性:评估VQA中模型预测与人类响应的差异

计算机视觉与模式识别 2024-10-07 v1 人工智能 计算与语言

摘要

大型视觉语言模型通常难以准确预测多位人类标注者的响应,尤其是在这些响应表现出人类不确定性时。本研究聚焦于视觉问答(VQA)任务,全面评估了最先进的视觉语言模型与人类响应分布的相关程度。为此,我们根据人类分歧不确定性(HUD)的水平(低、中、高)对样本进行分类,并不仅采用准确率,还采用了VQA中三种新的人类相关性指标来评估HUD的影响。为了更好地使模型与人类对齐,我们还验证了常见校准和人类校准的效果。我们的结果表明,即使是目前该任务上表现最好的BEiT3模型,也难以捕捉人类多样化响应中固有的多标签分布。此外,我们观察到,常用的面向准确率的校准技术会对BEiT3捕捉HUD的能力产生不利影响,进一步拉大了模型预测与人类分布之间的差距。相比之下,我们展示了在VQA中使模型向人类分布校准的益处,这能更好地使模型置信度与人类不确定性对齐。我们的研究结果强调,在VQA中,模型预测与人类响应的一致性问题尚未得到充分研究,应成为未来研究的关键方向。

关键词

引用

@article{arxiv.2410.02773,
  title  = {Mind the Uncertainty in Human Disagreement: Evaluating Discrepancies between Model Predictions and Human Responses in VQA},
  author = {Jian Lan and Diego Frassinelli and Barbara Plank},
  journal= {arXiv preprint arXiv:2410.02773},
  year   = {2024}
}