中文

MoCLIP-Lite:通过融合 CLIP 与运动向量实现视频识别的高效方案

计算机视觉与模式识别 2025-09-26 v2

摘要

视频动作识别是计算机视觉中的基础任务,但最先进模型往往计算昂贵且依赖大规模视频预训练。并行地,大规模视觉语言模型如 Contrastive Language-Image Pre-training (CLIP) 提供了在静态图像上的强大零样本能力,而运动向量 (MV) 直接从压缩视频流中提供高效的时序信息。为此,我们提出 MoCLIP-Lite,一个简单却强大的双流后期融合框架,用于高效视频识别。我们的方案将冻结的 CLIP 图像编码器特征与来自轻量级在 raw MV 上监督训练的网络特征融合。在融合过程中,两个 backbone 均保持冻结状态,仅训练一个微小的多层感知机(MLP)头部,确保极致的效率。通过在 UCF101 数据集上进行全面实验,我们的方法实现了惊人的 89.2% Top-1 准确率,显著优于强大的零样本(65.0%)和仅使用 MV(66.5%)基线。我们的工作为视频理解提供了一种新颖且高效的基线,有效弥合了大型静态模型与动态低成本运动线索之间的差距。我们的代码与模型已公开于 https://github.com/microa/MoCLIP-Lite。

关键词

引用

@article{arxiv.2509.17084,
  title  = {MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors},
  author = {Binhua Huang and Ni Wang and Arjun Pakrashi and Soumyabrata Dev},
  journal= {arXiv preprint arXiv:2509.17084},
  year   = {2025}
}

备注

6 pages, 3 figures