多模态智能:表示学习、信息融合与应用
人工智能
2020-07-15 v3 计算与语言
计算机视觉与模式识别
机器学习
摘要
自 2010 年以来,深度学习方法已彻底变革了语音识别、图像识别与自然语言处理。这些任务各自的输入信号均只涉及单一模态。然而,人工智能领域的许多应用涉及多种模态。因此,研究跨多模态建模与学习这一更困难且复杂的问题具有广泛意义。本文中,我们对多模态智能的可用模型与学习方法进行了技术性综述。本综述的重点是视觉与自然语言模态的结合,这已成为计算机视觉与自然语言处理研究群体中的一个重要课题。本综述从三个视角对近期多模态深度学习工作进行了全面分析:学习多模态表示、在各层次融合多模态信号,以及多模态应用。关于多模态表示学习,我们综述了嵌入的关键概念,其将多模态信号统一至单一向量空间,从而实现跨模态信号处理。我们还综述了为通用下游任务所构建与学习的多种嵌入的性质。关于多模态融合,本综述聚焦于为特定任务整合单模态信号表示的特殊架构。关于应用,涵盖了当前文献中广受关注的若干领域,包括图像到文本的字幕生成、文本到图像的生成,以及视觉问答。我们相信本综述将促进相关群体在新兴的多模态智能领域的未来研究。
引用
@article{arxiv.1911.03977,
title = {Multimodal Intelligence: Representation Learning, Information Fusion, and Applications},
author = {Chao Zhang and Zichao Yang and Xiaodong He and Li Deng},
journal= {arXiv preprint arXiv:1911.03977},
year = {2020}
}