玫瑰红,紫罗兰蓝……但 VQA 应当期望它们如此吗?
计算机视觉与模式识别
2021-04-08 v3
摘要
视觉问答(VQA)模型因其依赖数据集偏置的倾向而臭名昭著,因为所涉及问题与概念的大量且不平衡的多样性往往阻碍模型学习推理,导致它们转而进行有根据的猜测。在本文中,我们主张由测量整体域内准确率构成的标准评估指标具有误导性。由于问题与概念不平衡,这往往有利于利用微妙训练集统计的模型。另一种做法,即在训练与测试划分间朴素地引入人为分布偏移,也不完全令人满意。首先,这些偏移不反映真实世界趋势,导致不合适的模型;其次,由于偏移是手工制作的,所训练模型专为该特定设置设计,无法泛化到其他配置。我们提出旨在克服这些问题的 GQA-OOD 基准:我们测量并比较罕见与频繁问答对的准确率,并主张前者更适于推理能力的评估,我们通过训练为更多或更少利用偏置的模型实验验证了这一点。在涉及 7 个 VQA 模型与 3 种偏置消减技术的大规模研究中,我们还实验证明这些模型无法处理涉及不常见概念的问题,并给出未来研究方向的建议。
引用
@article{arxiv.2006.05121,
title = {Roses Are Red, Violets Are Blue... but Should Vqa Expect Them To?},
author = {Corentin Kervadec and Grigory Antipov and Moez Baccouche and Christian Wolf},
journal= {arXiv preprint arXiv:2006.05121},
year = {2021}
}