利用对抗正则化克服视觉问答中的语言先验
计算机视觉与模式识别
2018-11-12 v2
摘要
现代视觉问答(VQA)模型已被证明严重依赖训练期间学到的问答词之间的表层关联,例如不论图像内容如何都压倒性地报告房间类型为厨房或所进行运动为网球。最令人警觉的是,这一缺陷在评估时往往不能很好反映,因为测试分布中存在同样强的先验;然而,一个未能将问题扎根于图像内容的 VQA 系统在实际场景中很可能表现糟糕。本工作中,我们提出一种用于 VQA 的新颖正则化方案以减弱该效应。我们引入一个仅问题模型,其以 VQA 模型的问题编码为输入,且必须利用语言偏置才能成功。随后我们将训练设定为该 VQA 模型与此仅问题对手之间的对抗博弈——阻止 VQA 模型在其问题编码中捕获语言偏置。此外,我们利用该仅问题模型估计在考虑图像后模型置信度的提升,并显式最大化该提升以鼓励视觉扎根。我们的方法是模型无关的训练流程且易于实现。我们从经验上表明,它能在 VQA 数据集的一个对偏置敏感的划分上显著改善多个基模型的性能——在该任务上达到 state-of-the-art。此外,在标准 VQA 任务上,与现有减偏 VQA 模型相比,我们的方法精度下降明显更少。
引用
@article{arxiv.1810.03649,
title = {Overcoming Language Priors in Visual Question Answering with Adversarial Regularization},
author = {Sainandan Ramakrishnan and Aishwarya Agrawal and Stefan Lee},
journal= {arXiv preprint arXiv:1810.03649},
year = {2018}
}
备注
NIPS 2018. 11 pages ( with references ), 4 figures, 2 tables