中文

询问、注意与回答:探索视觉问答中问题引导的空间注意力

计算机视觉与模式识别 2016-03-22 v2 人工智能 计算与语言 神经与进化计算

摘要

我们解决视觉问答(VQA)问题,该问题需要联合图像与语言理解来回答关于给定照片的问题。近期方法将基于卷积-循环网络的深度图像描述方法应用于此问题,但未能建模空间推理。为此,我们提出一种称为空间记忆网络(Spatial Memory Network)的模型并将其应用于VQA任务。记忆网络是具有显式注意力机制的循环神经网络,该机制选择存储在记忆中的某些信息部分。我们的空间记忆网络将图像不同空间区域的神经元激活值存储于其记忆中,并利用问题选择相关区域以计算答案,这一过程构成了网络中的单次“跳”(hop)。我们提出一种新颖的空间注意力架构,在第一次跳中将单词与图像块对齐,并通过添加第二次注意力跳获得改进结果,该跳基于第一次跳的结果考虑整个问题来选择视觉证据。为了更好地理解网络学到的推理过程,我们设计了特别需要空间推理的合成问题并可视化注意力权重。我们在两个已发布的视觉问答数据集DAQUAR [1] 和 VQA [2] 上评估我们的模型,并与一个强大的深度基线模型(iBOWIMG,其拼接图像与问题特征来预测答案 [3])相比获得了改进结果。

关键词

引用

@article{arxiv.1511.05234,
  title  = {Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering},
  author = {Huijuan Xu and Kate Saenko},
  journal= {arXiv preprint arXiv:1511.05234},
  year   = {2016}
}

备注

include test-standard result on VQA full release (V1.0) dataset