中文

问我任何事:基于外部知识源的自由形式视觉问答

计算机视觉与模式识别 2016-04-15 v2

摘要

我们提出了一种视觉问答方法,其将图像内容的内部表示与从通用知识库提取的信息相结合,以回答广泛的基于图像的问题。这使得能够使用主流的基于神经网络的方法回答比以往可能的更复杂的问题。它特别允许针对图像内容提问,即使图像本身未包含完整答案。该方法构建图像语义内容的文本表示,并将其与来自知识库的文本信息合并,以对所见场景形成更深的理解。用该组合信息与提交的问题来引导一个循环神经网络,产生了一种非常灵活的视觉问答方法。我们特别能够回答以自然语言提出、涉及图像中未包含信息的问题。我们在两个公开数据集 Toronto COCO-QA 和 MS COCO-VQA 上展示了我们模型的有效性,并表明其在两种情况下均产生了已报道的最佳结果。

关键词

引用

@article{arxiv.1511.06973,
  title  = {Ask Me Anything: Free-form Visual Question Answering Based on Knowledge from External Sources},
  author = {Qi Wu and Peng Wang and Chunhua Shen and Anthony Dick and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1511.06973},
  year   = {2016}
}

备注

Accepted to IEEE Conf. Computer Vision and Pattern Recognition