中文

让VQA中的“V”至关重要:提升图像理解在视觉问答中的作用

计算机视觉与模式识别 2017-05-16 v3 人工智能 计算与语言 机器学习

摘要

视觉与语言交叉的问题既是重要研究难题,也支撑丰富应用。然而,世界中固有结构和语言偏见往往是比视觉模态更简单的学习信号,导致模型忽略视觉信息,造成对其能力的夸大。我们提议针对视觉问答(VQA)任务对抗这些语言先验,并使视觉(VQA中的V)至关重要!具体地,我们通过收集互补图像来平衡流行的VQA数据集,使得我们平衡数据集中每个问题不仅关联单张图像,而是关联一对相似图像,它们对问题产生两个不同答案。我们的数据集按构造比原始VQA数据集更平衡,且图像-问题对数量约两倍。我们完整的平衡数据集作为视觉问答数据集与挑战赛(VQA v2.0)的第二版一部分公开于www.visualqa.org。我们进一步在我们的平衡数据集上基准测试若干最先进VQA模型。所有模型在我们的平衡数据集上表现显著更差,表明这些模型确实学会了利用语言先验。该发现首次提供了从业者定性感觉的具体经验证据。最后,我们识别互补图像的数据收集协议使我们能开发一种新颖可解释模型,除给定(图像,问题)对提供答案外,还提供基于反例的解释。具体地,它识别与原始图像相似但认为对同一问题有不同答案的图像。这有助于在用户中建立对机器的信任。

关键词

引用

@article{arxiv.1612.00837,
  title  = {Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering},
  author = {Yash Goyal and Tejas Khot and Douglas Summers-Stay and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1612.00837},
  year   = {2017}
}