中文

高效大规模多模态分类

计算与语言 2018-02-09 v1 人工智能 计算机视觉与模式识别

摘要

虽然早期的互联网主要以文本为基础,但现代数字世界正变得日益多模态。在此,我们考察其中一种模态为离散型(如文本)、另一种为连续型(如从卷积神经网络迁移的视觉表示)的多模态分类。特别地,我们关注必须能够快速分类大量数据的场景。我们研究多种进行多模态融合的方法,并分析其在分类精度与计算效率上的权衡。我们的发现表明,在一系列多模态分类任务上,即便使用简单融合方法,引入连续信息也能较仅用文本提升性能。此外,我们尝试对连续特征进行离散化,以进一步加速并简化融合过程。我们的结果显示,使用离散化特征的融合以仅相当于完整多模态融合一小部分的计算成本优于仅文本分类,并附带可解释性提升的额外益处。

关键词

引用

@article{arxiv.1802.02892,
  title  = {Efficient Large-Scale Multi-Modal Classification},
  author = {D. Kiela and E. Grave and A. Joulin and T. Mikolov},
  journal= {arXiv preprint arXiv:1802.02892},
  year   = {2018}
}

备注

Published at AAAI-18, 7 pages