中文

PosMLP-Video:用于高效视频识别的空间和时间相对位置编码

计算机视觉与模式识别 2024-07-04 v1

摘要

近年来,视觉 Transformer 和 MLP 在图像理解任务中展现出惊人的性能。然而,其固有的稠密计算算子,如自注意力和 token 混合层,在应用于时空视频数据时将导致显著挑战。为此,我们提出了 PosMLP-Video,一种轻量且高效的 MLP 类骨干网络,用于视频识别。我们不使用稠密算子,而是使用高效的相对位置编码 (RPE) 来构建成对 token 之间的关系,利用小尺寸参数化的相对位置偏置获取每个关系得分。具体而言,为实现时空建模,我们将图像 PosMLP 的位置门控单元扩展为时序、时空和时空-时序变体,分别称为 PoTGU、PoSGU 和 PoSTGU。这些门控单元可以 feasibly 组合成三种时空分解位置 MLP 块,这不仅降低了模型复杂度,还保持了良好的性能。此外,我们通过通道分组丰富相对位置关系。实验结果表明,PosMLP-Video 在三个视频相关任务上实现了与前沿模型相竞争的速度-精度权衡。特别是,PosMLP-Video 在 ImageNet1K 上预训练后,在 Something-Something V1/V2 上实现了 59.0%/70.3% 的顶级1准确率,在 Kinetics-400 上实现了 82.1% 的顶级1准确率,而其他模型所需的参数和 FLOPs 数量更少。代码已发布于 https://github.com/zhouds1918/PosMLP_Video。

关键词

引用

@article{arxiv.2407.02934,
  title  = {PosMLP-Video: Spatial and Temporal Relative Position Encoding for Efficient Video Recognition},
  author = {Yanbin Hao and Diansong Zhou and Zhicai Wang and Chong-Wah Ngo and Meng Wang},
  journal= {arXiv preprint arXiv:2407.02934},
  year   = {2024}
}