论早期融合在多模态表征学习中的益处
机器学习
2020-11-17 v1 人工智能
摘要
对世界的智能推理通常需要整合来自多个模态的数据,因为任何单一模态都可能包含不可靠或不完整的信息。先前多模态学习的工作仅在经过大量独立处理后才融合输入模态。另一方面,大脑几乎立即进行多模态处理。常规多模态学习与神经科学之间的这种分歧表明,对早期多模态融合的详细研究可改进人工多模态表征。为促进早期多模态融合的研究,我们创建了一种卷积 LSTM 网络架构,可同时处理音频和视觉输入,并允许我们选择音频与视觉信息结合的层。我们的结果表明,在初始 C-LSTM 层中立即融合音频和视觉输入可得到性能更高、对音频和视觉输入中白噪声添加更具鲁棒性的网络。
引用
@article{arxiv.2011.07191,
title = {On the Benefits of Early Fusion in Multimodal Representation Learning},
author = {George Barnum and Sabera Talukder and Yisong Yue},
journal= {arXiv preprint arXiv:2011.07191},
year = {2020}
}