MUTANT:一种用于视觉问答中分布外泛化的训练范式
计算机视觉与模式识别
2020-10-19 v2 计算与语言
摘要
尽管视觉问答排行榜上已取得进展,但在独立同分布(i.i.d.)设定下,模型常利用数据集中的伪相关与先验。因此,在分布外(OOD)测试样本上的评估已成为泛化的一种替代指标。在本文中,我们提出 MUTANT,一种将模型暴露于感知相似但语义不同的输入变异以提升 OOD 泛化(如 VQA-CP 挑战)的训练范式。在此范式下,模型利用一致性约束训练目标来理解输入(问题-图像对)中语义变化对输出(答案)的影响。与 VQA-CP 上现有方法不同,MUTANT 不依赖于关于训练与测试答案分布性质的知识。MUTANT 在 VQA-CP 上以 的提升确立了新的最先进准确率。我们的工作为在问答中使用语义输入变异实现 OOD 泛化开辟了途径。
引用
@article{arxiv.2009.08566,
title = {MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering},
author = {Tejas Gokhale and Pratyay Banerjee and Chitta Baral and Yezhou Yang},
journal= {arXiv preprint arXiv:2009.08566},
year = {2020}
}
备注
Accepted to EMNLP 2020, Long Papers