中文

用于时空表征学习的运动引导掩码

计算机视觉与模式识别 2023-08-25 v1

摘要

若干近期工作将图像掩码自编码器(MAE)配合随机掩码直接扩展至视频领域,取得了有前景的结果。然而,不同于图像,空间与时间信息对视频理解均十分重要。这意味着继承自图像MAE的随机掩码策略对视频MAE效果较差。这促使我们设计一种能更高效利用视频显著性的新颖掩码算法。具体而言,我们提出运动引导掩码算法(MGM),其利用运动向量来引导各掩码随时间的位置。关键在于,这些基于运动的对应可直接从视频压缩格式中存储的信息获得,使我们的方法高效且可扩展。在两个具挑战性的大规模视频基准(Kinetics-400和Something-Something V2)上,我们为视频MAE配备MGM,相较先前最优方法最高提升+1.3%1.3\%。此外,我们的MGM使用最多少66%的训练轮数即取得与先前视频MAE相当的性能。最后,我们展示MGM在UCF101、HMDB51和Diving48数据集的下游迁移学习与域适应任务上泛化更好,相较基线方法最高提升+4.9%4.9\%

关键词

引用

@article{arxiv.2308.12962,
  title  = {Motion-Guided Masking for Spatiotemporal Representation Learning},
  author = {David Fan and Jue Wang and Shuai Liao and Yi Zhu and Vimal Bhat and Hector Santos-Villalobos and Rohith MV and Xinyu Li},
  journal= {arXiv preprint arXiv:2308.12962},
  year   = {2023}
}

备注

Accepted to ICCV 2023