作为时空学习器的级联掩码自编码器
计算机视觉与模式识别
2023-12-15 v2
摘要
从视频中学习表征需要理解帧间的连续运动与视觉对应。本文引入级联掩码自编码器(CatMAE)作为自监督视频表征学习的时空学习器。对于输入的视频帧序列,CatMAE 保持初始帧不变,而对后续帧施加大幅掩码(95%)。CatMAE 中的编码器负责逐帧独立编码各帧的可见块;随后,对于每个被掩码的帧,解码器利用前一帧与当前帧的可见块来重建原始图像。我们所提方法使模型能够估计可见块间的运动信息,匹配前后帧间的对应,并最终学习场景的演化。此外,我们提出一种新的数据增强策略 Video-Reverse(ViRe),其使用反转的视频帧作为模型的重建目标。这进一步鼓励模型利用连续运动细节与对应来完成重建,从而增强模型能力。相较于最先进的预训练方法,CatMAE 在视频分割任务与动作识别任务上均达到了领先水平。
引用
@article{arxiv.2311.00961,
title = {Concatenated Masked Autoencoders as Spatial-Temporal Learner},
author = {Zhouqiang Jiang and Bowen Wang and Tong Xiang and Zhaofeng Niu and Hong Tang and Guangshun Li and Liangzhi Li},
journal= {arXiv preprint arXiv:2311.00961},
year = {2023}
}
备注
https://github.com/minhoooo1/CatMAE