中文

基于稠密对称协同注意的视觉与语言表示融合改进及其在视觉问答中的应用

计算机视觉与模式识别 2018-12-04 v2

摘要

视觉问答 (VQA) 的一个关键解决方案在于如何融合从输入图像和问题中提取的视觉与语言特征。我们表明,一种能够在两种模态之间实现稠密双向交互的注意力机制有助于提升答案预测的准确率。具体而言,我们提出了一种在视觉与语言表示之间完全对称的简单架构,其中每个问题词关注图像区域,每个图像区域关注问题词。该架构可堆叠形成层次结构,以实现图像-问题对之间的多步交互。我们通过实验表明,尽管参数量小,所提架构在 VQA 和 VQA 2.0 上达到了新的 SOTA。我们还给出了定性评估,展示了所提注意力机制如何对图像和问题生成合理的注意力图,从而导向正确的答案预测。

关键词

引用

@article{arxiv.1804.00775,
  title  = {Improved Fusion of Visual and Language Representations by Dense Symmetric Co-Attention for Visual Question Answering},
  author = {Duy-Kien Nguyen and Takayuki Okatani},
  journal= {arXiv preprint arXiv:1804.00775},
  year   = {2018}
}

备注

In Proceeding of CVPR'2018