中文

重新评估视觉问答中的评估实践:一项关于分布外泛化的案例研究

计算与语言 2023-04-04 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

在大规模多模态数据上预训练的视觉与语言(V&L)模型已在图像描述与视觉问答(VQA)等多种任务上展现出强劲性能。此类模型的质量通常通过测量其在未见过的数据上的表现来评估,这些数据通常与训练数据来自同一分布。然而,在 VQA 的分布外(数据集外)设置下评估时,我们观察到这些模型泛化能力较差。我们通过跨数据集评估,在不同设置(即分类与开放式文本生成)下对两个预训练的 V&L 模型进行了全面评估。我们发现,这些模型倾向于学会解决基准测试,而非学习 VQA 任务所需的高层技能。我们还发现,在大多数情况下,生成式模型比判别式模型更不易受数据分布偏移的影响,且多模态预训练通常有助于分布外泛化。最后,我们重新审视了自动 VQA 评估指标使用背后的假设,并从经验上表明其严格性反复惩罚了正确的回答。

关键词

引用

@article{arxiv.2205.12191,
  title  = {Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization},
  author = {Aishwarya Agrawal and Ivana Kajić and Emanuele Bugliarello and Elnaz Davoodi and Anita Gergely and Phil Blunsom and Aida Nematzadeh},
  journal= {arXiv preprint arXiv:2205.12191},
  year   = {2023}
}

备注

Findings of EACL 2023. Aishwarya, Ivana, Emanuele and Aida had equal first author contributions. Elnaz and Anita had equal contributions. Aida and Aishwarya had equal senior contributions