用于分层联合表示的稠密多模态融合
计算机视觉与模式识别
2018-10-09 v1 多媒体
摘要
多种模态通过以不同方式描述相同内容,能提供比单一模态更有价值的信息。因此,高度期望通过融合不同模态的特征来学习有效的联合表示。然而,先前方法主要关注融合由单模态深度网络生成的浅层特征或高层表示,仅捕获了跨模态分层相关性的部分。本文中,我们提出通过在不同模态特定网络间贪心地堆叠多个共享层来稠密地整合表示,称为稠密多模态融合(DMF)。不同共享层中的联合表示能捕获不同层级的相关性,且共享层间的连接也为学习分层相关性间的依赖提供了高效途径。这两个性质共同促成了 DMF 中的多重学习路径,从而带来更快收敛、更低训练损失与更优性能。我们在三个典型多模态学习任务上评估了我们的模型,包括视听语音识别、跨模态检索与多模态分类。实验中显著的性能表明我们的模型能学习更有效的联合表示。
引用
@article{arxiv.1810.03414,
title = {Dense Multimodal Fusion for Hierarchically Joint Representation},
author = {Di Hu and Feiping Nie and Xuelong Li},
journal= {arXiv preprint arXiv:1810.03414},
year = {2018}
}
备注
10 pages, 4 figures