掩码运动预测器是强大的三维动作表征学习器
计算机视觉与模式识别
2023-08-15 v1
摘要
在三维人体动作识别中,有限的监督数据使得充分挖掘如 transformer 等强大网络的建模潜力具有挑战性。因此,研究者们积极探究有效的自监督预训练策略。本工作中,我们表明,不同于遵循流行的 pretext task 在人体关节上执行掩码自分量重建,显式的上下文运动建模是学习有效三维动作识别特征表征成功的关键。形式上,我们提出掩码运动预测(Masked Motion Prediction, MAMP)框架。具体而言,所提 MAMP 以掩码的时空骨架序列为输入,并预测被掩码人体关节的对应时间运动。考虑到骨架序列的高时间冗余性,在我们的 MAMP 中,运动信息还充当经验语义丰富性先验以引导掩码过程,促进对语义丰富时间区域的更好关注。在 NTU-60、NTU-120 和 PKU-MMD 数据集上的大量实验表明,所提 MAMP 预训练大幅提升了所采用的 vanilla transformer 的性能,在无需额外技巧的情况下取得了最先进(state-of-the-art, SOTA)结果。我们的 MAMP 源代码发布于 https://github.com/maoyunyao/MAMP。
引用
@article{arxiv.2308.07092,
title = {Masked Motion Predictors are Strong 3D Action Representation Learners},
author = {Yunyao Mao and Jiajun Deng and Wengang Zhou and Yao Fang and Wanli Ouyang and Houqiang Li},
journal= {arXiv preprint arXiv:2308.07092},
year = {2023}
}
备注
To appear in ICCV 2023