用于视觉问答的深度模块化协同注意力网络
计算机视觉与模式识别
2019-06-27 v1
摘要
视觉问答(VQA)需要对图像视觉内容与问题文本内容的细粒度同步理解。因此,设计一个有效的“协同注意力”模型来将问题中的关键词与图像中的关键对象相关联,是 VQA 性能的核心。迄今为止,协同注意力学习最成功的尝试大多通过使用浅层模型实现,而深度协同注意力模型相比其浅层对应模型提升甚微。本文提出一种深度模块化协同注意力网络(MCAN),由深度级联的模块化协同注意力(MCA)层组成。每个 MCA 层利用两个基本注意力单元的模块化组合,联合建模问题的自注意力、图像的自注意力以及图像的引导注意力。我们在基准 VQA-v2 数据集上对 MCAN 进行定量与定性评估,并开展大量消融实验以探究 MCAN 有效性背后的原因。实验结果表明,MCAN 显著优于先前的最优方法。我们最佳的单模型在 test-dev 集上取得了 70.63% 的总体准确率。代码见 https://github.com/MILVLG/mcan-vqa。
引用
@article{arxiv.1906.10770,
title = {Deep Modular Co-Attention Networks for Visual Question Answering},
author = {Zhou Yu and Jun Yu and Yuhao Cui and Dacheng Tao and Qi Tian},
journal= {arXiv preprint arXiv:1906.10770},
year = {2019}
}
备注
Accepted at CVPR 2019