面向多模态视频分类的跨模态学习
计算机视觉与模式识别
2020-06-09 v3 机器学习
摘要
多模态机器学习(ML)模型能够处理多种模态的数据(如视频、音频、文本),并在多种视频内容分析问题中(如目标检测、场景理解、活动识别)具有实用价值。本文关注利用多模态 ML 技术进行视频分类的问题。具体而言,我们提出了一种称为“跨模态学习”的新型多模态 ML 方法,其中某一模态在模态间存在相关性时才对另一模态产生影响——为此,我们首先训练一个相关性塔,用以引导模型中的主多模态视频分类塔。我们展示了该跨模态原理如何应用于不同类型的模型(如 RNN、Transformer、NetVLAD),并通过实验证明我们所提出的带跨模态学习的多模态视频分类模型优于强大的 SOTA 基线模型。
引用
@article{arxiv.2003.03501,
title = {Cross-modal Learning for Multi-modal Video Categorization},
author = {Palash Goyal and Saurabh Sahu and Shalini Ghosh and Chul Lee},
journal= {arXiv preprint arXiv:2003.03501},
year = {2020}
}