MGMAE:用于视频掩码自编码的运动引导掩码方法
计算机视觉与模式识别
2023-08-22 v1 机器学习
摘要
掩码自编码在自监督视频表征学习中已展现出优异性能。时间冗余导致 VideoMAE 中采用高掩码率和定制化掩码策略。本文中,我们旨在通过引入运动引导掩码策略进一步提升视频掩码自编码的性能。我们的核心见解是,运动是视频中通用且独特的先验,应在掩码预训练中被考虑。我们的运动引导掩码显式地融合运动信息以构建时间一致的掩码体。基于该掩码体,我们可在时间上追踪未掩码令牌,并从视频中采样一组时间一致的立方体。这些时间对齐的未掩码令牌将进一步缓解时间上的信息泄漏问题,并促使 MGMAE 学习更有用的结构信息。我们使用在线高效光流估计器和反向掩码图扭曲策略实现 MGMAE。我们在 Something-Something V2 和 Kinetics-400 数据集上进行实验,证明了我们的 MGMAE 相对于原始 VideoMAE 的优越性能。此外,我们提供可视化分析以说明我们的 MGMAE 能以运动自适应方式采样时间一致立方体,从而实现更有效的视频预训练。
引用
@article{arxiv.2308.10794,
title = {MGMAE: Motion Guided Masking for Video Masked Autoencoding},
author = {Bingkun Huang and Zhiyu Zhao and Guozhen Zhang and Yu Qiao and Limin Wang},
journal= {arXiv preprint arXiv:2308.10794},
year = {2023}
}
备注
ICCV 2023 camera-ready version