中文

SMILE: 在遮蔽视频学习中融合空间与运动语义

计算机视觉与模式识别 2025-04-02 v1

摘要

遮蔽视频建模,如 VideoMAE,是视频自监督学习(SSL)的有效范式。然而,它们主要基于自然视频中像素级细节的重建,这些视频具有显著的时序冗余,限制了其语义表征能力和运动动态编码的充分性。为此,本文提出一种新颖的视频表征学习自监督方法,称为 SMILE,通过融合空间语义和运动语义来实现。SMILE 利用图像-语言预训练模型如 CLIP 来引导学习过程,利用其高阶空间语义。通过在训练数据中引入合成运动模式来增强运动表征,使模型能够捕获更复杂和动态的内容。此外,使用 SMILE,我们建立了一种无需任何自然视频数据即可学习强大视频表征的自监督视频学习范式。我们在 7 个数据集上进行了广泛实验,涵盖各种下游场景。SMILE 超越当前最先进的 SSL 方法,展示了在学习更具辨识度和可泛化性视频表征方面的有效性。代码已公开: https://github.com/fmthoker/SMILE

关键词

引用

@article{arxiv.2504.00527,
  title  = {SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning},
  author = {Fida Mohammad Thoker and Letian Jiang and Chen Zhao and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2504.00527},
  year   = {2025}
}

备注

Accepted to CVPR 2025