中文

用于视觉问答的循环与上下文模型

计算与语言 2017-03-24 v1 计算机视觉与模式识别

摘要

我们提出了一系列用于 Visual7W 数据集上多项选择视觉问答的循环与上下文神经网络模型。受文献中模型复杂度趋势分歧的启发,我们通过研究逐步复杂化的架构,探索模型表达能力与简洁性之间的平衡。我们从对输入问题和答案的 LSTM 编码入手;在此基础上,利用神经图像与问题表示的 LSTM 编码生成上下文,并引入对图像的注意力机制;进而评估我们的模型及其集成的多样性与预测能力。所有模型均与一个受当前最先进方法启发的简单基线进行对比,该基线分别对文本和图像采用词袋表示与 CNN 表示的简单拼接。总体而言,我们观察到各模型在图像推理性能上存在显著差异,这从其整体性能中并不明显,同时也发现了数据集偏差的证据。我们的单一模型最高达到 64.6%64.6\% 的准确率,而所有模型的集成达到 66.67%66.67\% 的最佳准确率,距 Visual7W 当前的最先进水平仅 0.5%0.5\% 之差。

关键词

引用

@article{arxiv.1703.08120,
  title  = {Recurrent and Contextual Models for Visual Question Answering},
  author = {Abhijit Sharang and Eric Lau},
  journal= {arXiv preprint arXiv:1703.08120},
  year   = {2017}
}