中文

VideoMAC:视频掩码自编码器与卷积神经网络的结合

计算机视觉与模式识别 2024-03-01 v1

摘要

最近,类似掩码自编码器(MAE)的自监督学习技术的快速发展深刻影响了图像和视频的视觉表征学习。然而值得注意的是,现有主流的掩码图像/视频建模方法过度依赖资源密集型视觉变换器(ViT)作为特征编码器。本文提出一种新方法,称为 VideoMAC,将视频掩码自编码器与资源友好型卷积神经网络(ConvNets)结合。具体而言,VideoMAC 对随机抽取的视频帧对进行对称掩码。为防止掩码模式消散, 我们采用以稀疏卷积运算实现的卷积神经网络作为编码器。同时,我们提出一种简单而有效的掩码视频建模(MVM)方法,采用由在线编码器和指数移动平均目标编码器组成的双编码器架构,以促进视频中帧间重建一致性。此外,我们展示了 VideoMAC 使经典(ResNet)或现代(ConvNeXt)卷积编码器能够利用 MVM 的优势,在下游任务中超越基于 ViT 的方法,包括视频对象分割(+5.2%/6.4% J&F\mathcal{J}\&\mathcal{F})、身体部件传递(+6.3%/3.1% mIoU)和人体姿态跟踪(+10.2%/11.1% [email protected])。

关键词

引用

@article{arxiv.2402.19082,
  title  = {VideoMAC: Video Masked Autoencoders Meet ConvNets},
  author = {Gensheng Pei and Tao Chen and Xiruo Jiang and Huafeng Liu and Zeren Sun and Yazhou Yao},
  journal= {arXiv preprint arXiv:2402.19082},
  year   = {2024}
}

备注

accepted by IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024