基于记忆的多模态深度学习融合方法
机器学习
2020-10-26 v3 计算机视觉与模式识别
机器学习
摘要
与单模态方法相比,多模态数据用于深度机器学习已展现出前景,多模态特征的融合在若干应用中带来了性能提升。然而,大多数 state-of-the-art 方法使用朴素融合,独立处理特征流,忽略了融合过程中数据内可能的长期依赖。本文提出一种新颖的基于记忆的注意力融合层(Memory based Attentive Fusion),其通过结合当前特征与数据中的长期依赖来融合模态,从而使模型理解模态随时间的相对重要性。我们在融合层内引入显式记忆块,用于存储包含融合数据长期依赖的特征。来自单模态编码器的特征输入通过注意力组合与变换进行融合,随后将所得记忆派生特征与层输入进行朴素融合。遵循 state-of-the-art 方法,我们在两个具有不同模态的数据集上评估了所提融合方法的性能与泛化性。实验中,我们将基准网络中的朴素融合层替换为所提层以实现公平比较。实验结果表明,MBAF 层可跨不同模态与网络泛化,以增强融合并提升性能。
引用
@article{arxiv.2007.08076,
title = {Memory based fusion for multi-modal deep learning},
author = {Darshana Priyasad and Tharindu Fernando and Simon Denman and Sridha Sridharan and Clinton Fookes},
journal= {arXiv preprint arXiv:2007.08076},
year = {2020}
}
备注
Pre-print submitted to Information Fusion