中文

HCMS:面向高效视频识别的分层条件模态选择

计算机视觉与模式识别 2022-12-07 v3

摘要

视频本质上是多模态的。传统的视频识别流程通常融合多模态特征以提升性能。然而,这不仅计算代价高昂,而且忽略了不同视频依赖不同模态进行预测这一事实。本文提出分层条件模态选择(Hierarchical and Conditional Modality Selection, HCMS),一种简单而高效的多模态学习框架,用于高效视频识别。HCMS默认在低代价模态(即音频线索)上运行,并动态地在逐输入基础上实时决定是否使用计算昂贵的模态,包括外观与运动线索。这通过以分层方式组织的三个LSTM的协作实现。具体而言,运行在高代价模态上的LSTM包含一个门控模块,该模块以低层特征和历史信息作为输入,自适应地决定是否激活其对应模态;否则它简单地复用历史信息。我们在两个大规模视频基准FCVID和ActivityNet上进行了大量实验,结果表明所提方法能有效利用多模态信息提升分类性能,同时所需计算量大幅减少。

关键词

引用

@article{arxiv.2104.09760,
  title  = {HCMS: Hierarchical and Conditional Modality Selection for Efficient Video Recognition},
  author = {Zejia Weng and Zuxuan Wu and Hengduo Li and Jingjing Chen and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2104.09760},
  year   = {2022}
}

备注

18 pages, 7 figures