Skeleton2vec:一种面向骨骼序列的具有上下文化目标表示的自监督学习框架
计算机视觉与模式识别
2024-01-03 v1
摘要
自监督预训练范式在基于骨骼的动作识别领域得到了广泛探索。特别是,基于掩码预测的方法将预训练性能推向了新的高度。然而,这些方法将低级特征(如原始关节坐标或时间运动)作为掩码区域的预测目标,这并非最优选择。在本文中,我们表明使用高级上下文化特征作为预测目标可以实现更优越的性能。具体而言,我们提出了 Skeleton2vec,这是一个简单高效的自监督 3D 动作表示学习框架,它利用基于 Transformer 的教师编码器,以未掩码的训练样本为输入,生成潜在的上下文化表示作为预测目标。得益于自注意力机制,教师编码器生成的潜在表示能够融合整个训练样本的全局上下文,从而形成更丰富的训练任务。此外,考虑到骨骼序列中高度的时间相关性,我们提出了一种运动感知管状掩码策略,该策略将骨骼序列划分为若干管状区域,并基于运动先验在每个管内执行持续掩码,从而迫使模型建立长程时空连接并聚焦于动作语义更丰富的区域。在 NTU-60、NTU-120 和 PKU-MMD 数据集上的大量实验表明,我们提出的 Skeleton2vec 优于以往方法并取得了最先进(SOTA)的结果。
引用
@article{arxiv.2401.00921,
title = {Skeleton2vec: A Self-supervised Learning Framework with Contextualized Target Representations for Skeleton Sequence},
author = {Ruizhuo Xu and Linzhi Huang and Mei Wang and Jiani Hu and Weihong Deng},
journal= {arXiv preprint arXiv:2401.00921},
year = {2024}
}
备注
Submitted to CVPR 2024