中文

iVQA:逆向视觉问答

计算机视觉与模式识别 2018-03-19 v2

摘要

我们提出视觉问答的逆向问题(iVQA),并探索其作为视觉-语言理解基准的适用性。iVQA 任务是根据给定的图像和答案对生成相应的问题。由于答案所含信息少于问题,且问题具有较少可学习的偏差,因此 iVQA 模型需要比 VQA 模型更好地理解图像才能取得成功。我们将问题生成建模为一个多模态动态推理过程,并提出一个 iVQA 模型,该模型能够在部分生成的问题和答案的共同引导下逐步调整其注意力焦点。在评估方面,除了现有的语言指标外,我们还提出了一种新的排序指标。该指标比较真实问题在一组干扰项中的排名,从而可以研究不同算法的缺陷和误差来源。实验结果表明,我们的模型能够生成与给定答案匹配的、多样化、语法正确且内容相关的问题。

关键词

引用

@article{arxiv.1710.03370,
  title  = {iVQA: Inverse Visual Question Answering},
  author = {Feng Liu and Tao Xiang and Timothy M. Hospedales and Wankou Yang and Changyin Sun},
  journal= {arXiv preprint arXiv:1710.03370},
  year   = {2018}
}

备注

CVPR18 Spotlight