MMTM:用于CNN融合的多模态迁移模块
计算机视觉与模式识别
2020-04-01 v2 机器学习
摘要
在后期融合中,每种模态在一个独立的单模态卷积神经网络(CNN)流中处理,并在最后融合各模态的分数。由于其简单性,后期融合在许多最先进的多模态应用中仍占主导地位。在本文中,我们提出了一个简单的神经网络模块,用于在卷积神经网络中利用来自多种模态的知识。所提出的单元名为多模态迁移模块(Multimodal Transfer Module, MMTM),可添加在特征层次的不同层级,实现慢速模态融合。利用压缩与激励操作,MMTM利用多种模态的知识重新校准每个CNN流中通道维度的特征。与其他中间融合方法不同,所提出的模块可用于具有不同空间维度的卷积层中的特征模态融合。该方法的另一个优势是,它可以用最小的网络架构改动添加到单模态分支中,使每个分支都能用现有的预训练权重进行初始化。实验结果表明,我们的框架提升了知名多模态网络的识别准确率。我们在涵盖动态手势识别、语音增强以及RGB与身体关节的动作识别任务领域的四个数据集上展示了最先进或具竞争力的性能。
引用
@article{arxiv.1911.08670,
title = {MMTM: Multimodal Transfer Module for CNN Fusion},
author = {Hamid Reza Vaezi Joze and Amirreza Shaban and Michael L. Iuzzolino and Kazuhito Koishida},
journal= {arXiv preprint arXiv:1911.08670},
year = {2020}
}