Video-FocalNets:用于视频动作识别的时空焦点调制
计算机视觉与模式识别
2023-10-30 v4 人工智能
摘要
近期的视频识别模型利用Transformer模型进行长程时空上下文建模。视频Transformer设计基于自注意力,能够以高计算代价建模全局上下文。相比之下,视频的卷积设计提供了一种高效替代方案,但缺乏长程依赖建模能力。为兼顾两类设计的优势,本文提出Video-FocalNet,一种高效且有效的视频识别架构,可同时建模局部与全局上下文。Video-FocalNet基于时空焦点调制架构,该架构反转了自注意力的交互与聚合步骤以提升效率。此外,聚合步骤与交互步骤均使用高效卷积与逐元素乘法操作实现,其计算开销低于视频表示上自注意力对应的操作。我们广泛探索了基于焦点调制的时空上下文建模的设计空间,并证明了我们的并行空间与时间编码设计是最优选择。在五个大规模数据集(Kinetics-400、Kinetics-600、SS-v2、Diving-48和ActivityNet-1.3)上,Video-FocalNets以更低的计算代价优于最先进的基于Transformer的视频识别模型。我们的代码/模型发布于 https://github.com/TalalWasim/Video-FocalNets。
引用
@article{arxiv.2307.06947,
title = {Video-FocalNets: Spatio-Temporal Focal Modulation for Video Action Recognition},
author = {Syed Talal Wasim and Muhammad Uzair Khattak and Muzammal Naseer and Salman Khan and Mubarak Shah and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2307.06947},
year = {2023}
}
备注
Accepted to ICCV-2023. Camera-Ready version. Project page: https://TalalWasim.github.io/Video-FocalNets/