中文

GeThR-Net:一种用于多模态信息融合的泛化时序混合循环神经网络

计算机视觉与模式识别 2016-09-20 v1

摘要

真实世界事件产生的数据通常具有时序性,并包含音频、视觉、深度、传感器等多模态信息,这些信息需要被智能地组合以用于分类任务。在本文中,我们提出了一种新颖的泛化深度神经网络架构,将来自多种模态的时序流进行组合。所提出的网络共有 M+1 个组件(M 为模态数)。第一个组件是一种新颖的时序混合循环神经网络(RNN),它通过允许网络学习特定于模态的时序动态以及多模态特征空间中的动态,来利用多模态时序信息的互补性质。网络中加入了 M 个额外组件,用于从每种模态中提取具有判别性但非时序的线索。最后,使用一组自动学习的权重将所有这些组件的预测进行线性组合。我们在跨越四种模态的三个不同数据集上进行了详尽的实验。对于 UCF-101、CCV 和 Multimodal Gesture 数据集,所提出的网络分别比表现最好的时序多模态基线方法相对提升了 3.5%、5.7% 和 2%。

关键词

引用

@article{arxiv.1609.05281,
  title  = {GeThR-Net: A Generalized Temporally Hybrid Recurrent Neural Network for Multimodal Information Fusion},
  author = {Ankit Gandhi and Arjun Sharma and Arijit Biswas and Om Deshmukh},
  journal= {arXiv preprint arXiv:1609.05281},
  year   = {2016}
}

备注

To appear in ECCV workshop on Computer Vision for Audio-Visual Media, 2016