从场景图自动生成对比集:探查 GQA 的组合一致性
计算与语言
2021-03-18 v1 计算机视觉与模式识别
摘要
近期工作表明,有监督模型常利用数据伪影获得良好的测试分数,而其性能在训练分布之外的样本上严重退化。对比集(Gardner et al., 2020)通过对测试样本进行最小扰动以改变输出标签来量化此现象。尽管大多数对比集为人工创建,需要大量标注工作,我们提出了一种新方法,利用丰富的语义输入表示来为视觉问答任务自动生成对比集。我们的方法计算扰动后问题的答案,从而大幅降低标注成本,并实现对模型在各种语义方面(如空间或关系推理)性能的彻底评估。我们在 GQA 数据集及其语义场景图图像表示上展示了我们方法的有效性。我们发现,尽管 GQA 具有组合性且标签分布经过精心平衡,两个高性能模型的准确率相较原始测试集下降了 13-17%。最后,我们表明可将我们的自动扰动应用于训练集以缓解性能退化,为更鲁棒的模型打开了大门。
引用
@article{arxiv.2103.09591,
title = {Automatic Generation of Contrast Sets from Scene Graphs: Probing the Compositional Consistency of GQA},
author = {Yonatan Bitton and Gabriel Stanovsky and Roy Schwartz and Michael Elhadad},
journal= {arXiv preprint arXiv:2103.09591},
year = {2021}
}
备注
Accepted to NAACL 2021