中文

基于运动感知掩码自编码器的自监督视频表征学习

计算机视觉与模式识别 2022-10-11 v1

摘要

掩码自编码器(MAEs)近来已成为自监督时空表征学习器。然而,继承自图像领域的现有视频 MAE 仍主要聚焦于静态外观学习,而在学习动态时间信息方面存在局限,因此对视频下游任务效果有限。为解决这一缺陷,本文提出一种运动感知变体——MotionMAE。除学习重建视频帧中被掩码的单个块之外,我们的模型还被设计用于额外预测随时间对应的运动结构信息。该运动信息可从相邻帧的时间差分中获得。因此,我们的模型能够自发地有效提取静态外观与动态运动,从而具备更优的时空表征学习能力。大量实验表明,在领域特定与领域通用预训练后微调两种设置下,我们的 MotionMAE 均显著优于有监督学习基线及最先进的 MAE 替代方法。特别地,在以 ViT-B 为骨干网络时,领域特定预训练设置下我们的 MotionMAE 在 Something-Something V2 上超越先前最优模型 1.2%,在 UCF101 上超越 3.2%。令人鼓舞的是,在具有挑战性的视频目标分割任务上,它也以超过 3% 的大幅优势超越竞争 MAE。代码见 https://github.com/happy-hsy/MotionMAE。

关键词

引用

@article{arxiv.2210.04154,
  title  = {Self-supervised Video Representation Learning with Motion-Aware Masked Autoencoders},
  author = {Haosen Yang and Deng Huang and Bin Wen and Jiannan Wu and Hongxun Yao and Yi Jiang and Xiatian Zhu and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2210.04154},
  year   = {2022}
}

备注

17 pages, 6 figures