中文

利用时间相干性进行多模态视频分类

计算机视觉与模式识别 2020-06-09 v2 机器学习 机器学习

摘要

多模态ML模型能够处理多种模态(如视频、图像、音频、文本)的数据,并在多种视频内容分析问题中(如目标检测、场景理解)有用。在本文中,我们聚焦于使用多模态方法进行视频分类问题。我们开发了一种新颖的基于时间相干性的正则化方法,其适用于不同类型的模型(如RNN、NetVLAD、Transformer)。我们通过实验证明,我们提出的具有时间相干性的多模态视频分类模型优于强大的最先进基线模型。

关键词

引用

@article{arxiv.2002.03844,
  title  = {Exploiting Temporal Coherence for Multi-modal Video Categorization},
  author = {Palash Goyal and Saurabh Sahu and Shalini Ghosh and Chul Lee},
  journal= {arXiv preprint arXiv:2002.03844},
  year   = {2020}
}