基于时序数据的深度多模态表示学习
计算机视觉与模式识别
2017-04-12 v1
摘要
近年来,深度学习已成功应用于多模态学习问题,旨在数据融合应用中学习有用的联合表示。当可用模态由视频、音频和传感器信号等时间序列数据组成时,在融合过程中考虑其时间结构变得势在必行。本文中,我们提出相关性循环神经网络(Correlational Recurrent Neural Network, CorrRNN),一种新颖的时间融合模型,用于融合本质上具有时间性的多输入模态。我们提出模型的关键特征包括:(i) 联合表示与模态间时间依赖性的同时学习;(ii) 在目标函数中使用多个损失项,包括最大相关损失项以增强跨模态信息的学习;(iii) 使用注意力模型动态调整不同输入模态对联合表示的贡献。我们通过在两个不同任务上的实验验证我们的模型:基于视频和传感器的活动分类,以及视听语音识别。我们实证分析了所提出的CorrRNN模型不同组件的贡献,并证明了其在多个数据集上的鲁棒性、有效性和最先进性能。
引用
@article{arxiv.1704.03152,
title = {Deep Multimodal Representation Learning from Temporal Data},
author = {Xitong Yang and Palghat Ramesh and Radha Chitta and Sriganesh Madhvanath and Edgar A. Bernal and Jiebo Luo},
journal= {arXiv preprint arXiv:1704.03152},
year = {2017}
}
备注
To appear in CVPR 2017