多模态迁移深度学习及其在视听识别中的应用
神经与进化计算
2016-02-19 v2 机器学习
摘要
我们提出了一种迁移深度学习 (TDL) 框架,该框架可以将从单模态神经网络获得的知识迁移到具有不同模态的网络中。具体来说,我们展示了在给定同一语义下的初始音视频并行数据集的情况下,可以利用语音数据来微调为视频识别训练的网络。我们的方法首先学习从每个网络中间层学到的抽象表征之间的类比保持嵌入,从而实现源模态和目标模态之间的语义级迁移。然后,我们应用神经网络操作,利用从源网络迁移来的额外知识微调目标网络,同时保持目标网络的拓扑结构不变。虽然我们以视听识别任务作为我们方法的一个应用实例,但我们的框架是灵活的,因此可以处理任何多模态数据集,或任何共享共同底层语义的现有深度网络。在这份进展报告中,我们旨在提供在两个广泛使用的视听数据集上对所提方法不同配置的综合结果,并讨论所提方法的潜在应用。
引用
@article{arxiv.1412.3121,
title = {Multimodal Transfer Deep Learning with Applications in Audio-Visual Recognition},
author = {Seungwhan Moon and Suyoun Kim and Haohan Wang},
journal= {arXiv preprint arXiv:1412.3121},
year = {2016}
}
备注
6 pages, MMML workshop at NIPS 2015