中文

用于视觉问答的组合记忆

计算机视觉与模式识别 2015-11-19 v1

摘要

视觉问答 (VQA) 近期成为计算机视觉中最引人入胜的话题之一。许多最先进的方法朴素地将整体视觉特征与语言特征输入长短期记忆 (LSTM) 模块,忽视了它们之间复杂的相互作用。这种粗糙的建模也阻碍了探索随时间动态贡献于问答的更细粒度局部特征的可能性。本文通过直接建模语言与所有可能出现局部图像块之间的时间动态来解决这一基本问题。当顺序遍历问题单词时,我们的端到端方法在注意力机制中显式融合与单词相关的特征以及多个局部块上可用的特征,并进一步组合融合信息以生成动态消息,我们称之为片段 (episode)。然后我们将这些片段与上下文视觉信息和语言信息一起输入标准问答模块。受深度学习近期实践的启发,我们在训练期间使用辅助损失函数以提升性能。我们在两个最新公开数据集上的实验表明我们的方法具有优越性能。值得注意的是,在 DARQUAR 数据集上我们将最先进水平提升了 6%\%,并且我们还在最新的 MSCOCO-VQA 数据集上评估了我们的方法。

关键词

引用

@article{arxiv.1511.05676,
  title  = {Compositional Memory for Visual Question Answering},
  author = {Aiwen Jiang and Fang Wang and Fatih Porikli and Yi Li},
  journal= {arXiv preprint arXiv:1511.05676},
  year   = {2015}
}