勿臆测,观图作答:克服视觉问答中的先验偏置
摘要
多项研究发现,当今的视觉问答(VQA)模型严重受训练数据中表层相关性的驱动,缺乏充分的图像 grounding。为鼓励开发面向后者的模型,我们提出了一种新的 VQA 设定:对于每一类问题,训练集与测试集具有不同答案先验分布。具体而言,我们给出了 VQA v1 与 VQA v2 数据集的新划分,分别称为 Visual Question Answering under Changing Priors(VQA-CP v1 与 VQA-CP v2)。首先,我们在该新设定下评估若干现有 VQA 模型,表明其性能相较原始 VQA 设定显著下降。其次,我们提出一种新颖的 Grounded Visual Question Answering 模型(GVQA),其在架构中引入归纳偏置与限制,专门防止模型主要通过依赖训练数据中的先验来“作弊”。具体而言,GVQA 显式解耦图像中视觉概念的识别与给定问题下合理答案空间的确定,使模型能更鲁棒地泛化至不同答案分布。GVQA 基于现有 VQA 模型 Stacked Attention Networks(SAN)构建。我们的实验表明,GVQA 在 VQA-CP v1 与 VQA-CP v2 数据集上均显著优于 SAN,且在多种情况下优于更强的 VQA 模型如 Multimodal Compact Bilinear Pooling(MCB)。在原始 VQA v1 与 VQA v2 数据集上训练与评估时,GVQA 具备与 SAN 互补的优势。最后,GVQA 比现有 VQA 模型更具透明性与可解释性。
引用
@article{arxiv.1712.00377,
title = {Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering},
author = {Aishwarya Agrawal and Dhruv Batra and Devi Parikh and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:1712.00377},
year = {2018}
}
备注
15 pages, 10 figures. To appear in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018