中文

MoCrop:用于高效视频动作识别的无训练运动引导裁切

计算机视觉与模式识别 2026-02-03 v2

摘要

标准视频动作识别模型通常处理的是通常调整大小的完整帧,导致空间冗余和高计算成本。为此,我们引入了MoCrop——一个针对高效视频动作识别在压缩域中的运动感知自适应裁切模块。利用H.264视频中天然可用的运动向量(MVs),MoCrop定位运动稠密区域,以在推理时生成自适应裁切,而无需任何训练或参数更新。我们的轻量级管道融合了三个关键组件:合并与去噪(MD)用于离群值过滤,蒙特卡洛抽样(MCS)用于高效重要抽样,运动网格搜索(MGS)用于最佳区域定位。此设计使MoCrop能够作为多样化背板的通用“即插即用”模块。广泛的UCF101上的实验表明,MoCrop既是加速器也是增强器。以ResNet-50为例,可在等效FLOPs(注意力设置)下实现Top-1准确率提升3.5%,或在26.5%更少的FLOPs(效率设置)下获得2.4%的准确率提升。当应用于CoViAR时,可将准确率提高到89.2%或将计算量约减27%(从11.6降至8.5 GFLOPs)。MobileNet-V3、EfficientNet-B1和Swin-B的持续提升确认了其强大的通用性和实时部署的适合性。我们的代码和模型可在 https://github.com/microa/MoCrop 获取。

关键词

引用

@article{arxiv.2509.18473,
  title  = {MoCrop: Training Free Motion Guided Cropping for Efficient Video Action Recognition},
  author = {Binhua Huang and Wendong Yao and Shaowu Chen and Guoxin Wang and Qingyuan Wang and Soumyabrata Dev},
  journal= {arXiv preprint arXiv:2509.18473},
  year   = {2026}
}

备注

6 pages, 3 figures