面向视觉问答的多模态残差学习
计算机视觉与模式识别
2016-09-01 v2
摘要
深度神经网络通过各种方法持续推动图像识别任务的最先进水平。然而,这些方法在多模态领域的应用仍然有限。我们提出多模态残差网络(Multimodal Residual Networks, MRN),用于视觉问答的多模态残差学习,扩展了深度残差学习的理念。与深度残差学习不同,MRN有效学习来自视觉和语言信息的联合表示。主要思想是利用逐元素乘法进行联合残差映射,借鉴近期研究中注意力模型的残差学习。基于我们的研究,探索了多模态引入的各种替代模型。我们在Visual QA数据集上,针对开放式和多项选择任务均取得了最先进的结果。此外,我们引入一种新颖方法,使用反向传播算法可视化每个学习块的联合表示注意力效应,即使视觉特征在没有空间信息的情况下被压缩。
引用
@article{arxiv.1606.01455,
title = {Multimodal Residual Learning for Visual QA},
author = {Jin-Hwa Kim and Sang-Woo Lee and Dong-Hyun Kwak and Min-Oh Heo and Jeonghee Kim and Jung-Woo Ha and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1606.01455},
year = {2016}
}
备注
13 pages, 7 figures, accepted for NIPS 2016