基于模态内与模态间注意力流动态融合的视觉问答方法
计算机视觉与模式识别
2019-08-27 v4 图像与视频处理
摘要
学习多模态特征的有效融合是视觉问答的核心。我们提出了一种利用模态内与模态间信息流动态融合多模态特征的新方法,该信息流在视觉与语言模态之间以及各模态内部交替传递动态信息。它能够稳健地捕捉语言与视觉领域之间的高层交互,从而显著提升视觉问答的性能。我们还表明,所提出的以另一模态为条件的动态模态内注意力流能够动态调节目标模态的模态内注意力,这对于多模态特征融合至关重要。在 VQA 2.0 数据集上的实验评估表明,所提方法取得了当前最优的 VQA 性能。我们进行了大量消融实验以对所提方法进行全面分析。
引用
@article{arxiv.1812.05252,
title = {Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering},
author = {Gao Peng and Zhengkai Jiang and Haoxuan You and Pan Lu and Steven Hoi and Xiaogang Wang and Hongsheng Li},
journal= {arXiv preprint arXiv:1812.05252},
year = {2019}
}
备注
CVPR 2019 ORAL