中文

让 groundedness 再度重要:面向 Document VQA 模型的评估方法

计算与语言 2025-03-26 v1 人工智能

摘要

文档视觉问答(VQA)模型在过去几年中以惊人的速度发展,接近或匹配人类在某些基准测试上的性能。我们认为,流行基准测试所使用的常见评估指标未能考虑模型输出在语义和多模态 groundedness 方面的考量。因此,幻觉和重大语义错误会被视为与 well-grounded 输出相同,评估分数也无法反映模型的推理能力。为此,我们提出了一种新的评估方法,考虑预测在语义特征和输入文档中多模态位置上的 groundedness。我们的方法以可配置的参数化方式设计,用户可根据自身偏好调整得分。我们通过人类判断验证了该评分方法的潜在影响,展示了其对现有热门 leaderboard 的影响。通过大规模分析,我们展示我们提出的方法产生的分数更能指示模型的鲁棒性,倾向于为更 well-calibrated 的答案提供更高的奖励。

关键词

引用

@article{arxiv.2503.19120,
  title  = {Where is this coming from? Making groundedness count in the evaluation of Document VQA models},
  author = {Armineh Nourbakhsh and Siddharth Parekh and Pranav Shetty and Zhao Jin and Sameena Shah and Carolyn Rose},
  journal= {arXiv preprint arXiv:2503.19120},
  year   = {2025}
}

备注

Accepted to NAACL Findings 2025