中文

逆向视觉问答:一个新的基准与 VQA 诊断工具

计算机视觉与模式识别 2018-03-20 v1

摘要

近年来,视觉问答(VQA)已成为热门话题。VQA 作为人工智能基准的重要前提是,需要对图像和文本问题都有很好的理解,并使二者相互契合,以推断出正确答案。然而,当前的 VQA 模型或许“理解”得比最初预期的要少,而是掌握了利用问题中泄露的线索和答案分布偏差这一更简单的任务。在本文中,我们提出了 VQA 的逆向问题(iVQA)。iVQA 的任务是生成与给定图像和答案对相匹配的问题。我们提出了一个变分 iVQA 模型,该模型能够生成与给定答案相匹配的、多样的、语法正确且内容相关的问题。基于该模型,我们表明 iVQA 是一个有趣的视觉-语言理解基准,并且是比 VQA 更具挑战性的替代方案,因为 iVQA 模型需要更好地理解图像才能取得成功。作为第二个贡献,我们展示了如何在一种新颖的强化学习框架中使用 iVQA,通过暴露其信念集(即对于给定图像,VQA 模型会预测为真的问答对集合)来诊断任何现有的 VQA 模型。这为深入了解 VQA 模型对图像的“信念”提供了一个全新的窗口。我们表明,现有的 VQA 模型比之前认为的拥有更多错误的信念,揭示了其内在弱点。随后,我们提出了未来如何解决这些弱点的建议。

关键词

引用

@article{arxiv.1803.06936,
  title  = {Inverse Visual Question Answering: A New Benchmark and VQA Diagnosis Tool},
  author = {Feng Liu and Tao Xiang and Timothy M. Hospedales and Wankou Yang and Changyin Sun},
  journal= {arXiv preprint arXiv:1803.06936},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1710.03370