利用视觉接地问题编码器降低视觉问答中的语言偏置
计算机视觉与模式识别
2020-07-21 v2 计算与语言
摘要
近期研究表明,当前的 VQA 模型严重依赖于训练集中的语言先验来回答问题,而不顾图像内容。例如, overwhelmingly 将“what sport is”回答为“tennis”,或将“what color banana”回答为“yellow”。这种行为限制了它们在真实场景中的应用。本文中,我们提出一种新颖的模型无关问题编码器——视觉接地问题编码器(VGQE),用于降低 VQA 中的此类影响。VGQE 在编码问题时同等利用视觉与语言两种模态,因此问题表示本身获得了充分的视觉接地,从而降低了模型对语言先验的依赖。我们在三种近期 VQA 模型上展示了 VGQE 的效果,并在 VQAv2 数据集的偏置敏感划分 VQA-CPv2 上取得了 SOTA 结果。此外,与现有偏置降低技术不同,在标准的 VQAv2 基准上,我们的方法未降低精度,反而提升了性能。
引用
@article{arxiv.2007.06198,
title = {Reducing Language Biases in Visual Question Answering with Visually-Grounded Question Encoder},
author = {Gouthaman KV and Anurag Mittal},
journal= {arXiv preprint arXiv:2007.06198},
year = {2020}
}
备注
ECCV 2020