中文

VQABQ:基于基本问题的视觉问答

计算机视觉与模式识别 2017-08-30 v2 计算与语言

摘要

以图像和问题作为我们方法的输入,它可以输出关于给定图像的查询问题的文本答案,这被称为视觉问答(VQA)。我们的算法有两个主要模块。给定一个关于图像的自然语言问题,第一个模块以该问题为输入,然后输出主给定问题的基本问题。第二个模块以主问题、图像和这些基本问题为输入,然后输出主问题的文本答案。我们将基本问题生成问题形式化为一个LASSO优化问题,并提出了一个关于如何利用这些基本问题来帮助回答主问题的准则。我们的方法在具有挑战性的VQA数据集上进行了评估,并在开放式任务中取得了60.34%的最先进准确率。

关键词

引用

@article{arxiv.1703.06492,
  title  = {VQABQ: Visual Question Answering by Basic Questions},
  author = {Jia-Hong Huang and Modar Alfadly and Bernard Ghanem},
  journal= {arXiv preprint arXiv:1703.06492},
  year   = {2017}
}

备注

Accepted by CVPR 2017 VQA Challenge Workshop. (Tables updated)