面向视频动作分类的互模态学习
计算机视觉与模式识别
2020-11-06 v1
摘要
视频动作分类模型的构建进展迅速。然而,这些模型的性能仍可通过与基于不同模态(如光流)训练的相同模型集成而轻易提升。遗憾的是,推理时使用多种模态计算开销巨大。近期工作探究了将多模态优势整合进单一 RGB 模型的方法,但仍有改进空间。本文探索将集成威力嵌入单一模型的各种方法。我们表明恰当的初始化以及互模态学习可增强单模态模型。由此,我们在 Something-Something-v2 基准上取得了当前最优结果。
引用
@article{arxiv.2011.02543,
title = {Mutual Modality Learning for Video Action Classification},
author = {Stepan Komkov and Maksim Dzabraev and Aleksandr Petiushko},
journal= {arXiv preprint arXiv:2011.02543},
year = {2020}
}