中文

从场景图自动生成对比集:探查 GQA 的组合一致性

计算与语言 2021-03-18 v1 计算机视觉与模式识别

摘要

近期工作表明,有监督模型常利用数据伪影获得良好的测试分数,而其性能在训练分布之外的样本上严重退化。对比集(Gardner et al., 2020)通过对测试样本进行最小扰动以改变输出标签来量化此现象。尽管大多数对比集为人工创建,需要大量标注工作,我们提出了一种新方法,利用丰富的语义输入表示来为视觉问答任务自动生成对比集。我们的方法计算扰动后问题的答案,从而大幅降低标注成本,并实现对模型在各种语义方面(如空间或关系推理)性能的彻底评估。我们在 GQA 数据集及其语义场景图图像表示上展示了我们方法的有效性。我们发现,尽管 GQA 具有组合性且标签分布经过精心平衡,两个高性能模型的准确率相较原始测试集下降了 13-17%。最后,我们表明可将我们的自动扰动应用于训练集以缓解性能退化,为更鲁棒的模型打开了大门。

关键词

引用

@article{arxiv.2103.09591,
  title  = {Automatic Generation of Contrast Sets from Scene Graphs: Probing the Compositional Consistency of GQA},
  author = {Yonatan Bitton and Gabriel Stanovsky and Roy Schwartz and Michael Elhadad},
  journal= {arXiv preprint arXiv:2103.09591},
  year   = {2021}
}

备注

Accepted to NAACL 2021