用于视觉与语言交互的多模态统一注意力网络
计算机视觉与模式识别
2019-08-20 v2
摘要
学习一种针对多模态数据的有效注意力机制在许多需要协同理解视觉与文本内容的视觉与语言任务中十分重要。现有的最先进方法使用协同注意力模型将每个视觉对象(如图像区域)与每个文本对象(如查询词)相关联。尽管这些协同注意力模型取得了成功,它们仅建模了模态间交互而忽略了模态内交互。本文提出一种通用的“统一注意力”模型,可同时捕捉多模态特征的模态内与模态间交互,并输出其相应的注意力表示。通过深度堆叠此类统一注意力块,我们得到了深度多模态统一注意力网络(MUAN),其可无缝应用于视觉问答(VQA)与视觉定位任务。我们在两个 VQA 数据集和三个视觉定位数据集上评估了我们的 MUAN 模型,结果表明 MUAN 在两项任务上均取得了顶级性能,且无需额外技巧。
引用
@article{arxiv.1908.04107,
title = {Multimodal Unified Attention Networks for Vision-and-Language Interactions},
author = {Zhou Yu and Yuhao Cui and Jun Yu and Dacheng Tao and Qi Tian},
journal= {arXiv preprint arXiv:1908.04107},
year = {2019}
}
备注
11 pages, 7 figures