中文

用于视觉问答的多模态分解双线性池化与协同注意力学习

计算机视觉与模式识别 2017-08-07 v1

摘要

视觉问答(VQA)具有挑战性,因为它需要同时理解图像的视觉内容和问题的文本内容。用于以细粒度方式表示图像和问题以及融合这些多模态特征的方法对性能起着关键作用。基于双线性池化的模型已被证明在VQA上优于传统的线性模型,但其高维表示和高计算复杂度可能严重限制其在实践中的适用性。对于多模态特征融合,我们在此开发了一种多模态分解双线性(MFB)池化方法,以高效且有效地组合多模态特征,与其他双线性池化方法相比,在VQA上取得了优越的性能。对于细粒度的图像和问题表示,我们开发了一种协同注意力机制,使用端到端的深度网络架构来联合学习图像和问题注意力。将所提出的MFB方法与协同注意力学习结合在一个新的网络架构中,为VQA提供了一个统一的模型。我们的实验结果表明,带有协同注意力的单一MFB模型在真实世界的VQA数据集上达到了新的最先进性能。代码可在https://github.com/yuzcccc/mfb获取。

关键词

引用

@article{arxiv.1708.01471,
  title  = {Multi-modal Factorized Bilinear Pooling with Co-Attention Learning for Visual Question Answering},
  author = {Zhou Yu and Jun Yu and Jianping Fan and Dacheng Tao},
  journal= {arXiv preprint arXiv:1708.01471},
  year   = {2017}
}

备注

ICCV 2017