SkeletonMAE:基于图结构的骨架序列预训练掩码自编码器
计算机视觉与模式识别
2023-07-18 v1
摘要
骨架序列表示学习因其在建模人体关节与拓扑结构方面的良好能力,已在动作识别中展现出巨大优势。然而,现有方法通常需要充足标注数据来训练计算昂贵的模型,这耗时费力。此外,这些方法忽视了如何利用不同骨架关节间的细粒度依赖关系,来预训练一个能跨数据集良好泛化的高效骨架序列学习模型。本文中,我们提出一种高效的骨架序列学习框架,称为骨架序列学习(SSL)。为全面捕捉人体姿态并获得具判别性的骨架序列表示,我们构建了名为 SkeletonMAE 的非对称基于图的编码器–解码器预训练架构,其将骨架关节序列嵌入图卷积网络(GCN),并基于先验人体拓扑知识重建被掩码的骨架关节与边。随后,将预训练的 SkeletonMAE 编码器与时空表示学习(STRL)模块整合以构建 SSL 框架。大量实验结果表明,我们的 SSL 跨数据集泛化良好,并在 FineGym、Diving48、NTU 60 与 NTU 120 数据集上优于最先进的自监督基于骨架的动作识别方法。此外,我们取得了与部分全监督方法相当的性能。代码见 https://github.com/HongYan1123/SkeletonMAE。
引用
@article{arxiv.2307.08476,
title = {SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence Pre-training},
author = {Hong Yan and Yang Liu and Yushen Wei and Zhen Li and Guanbin Li and Liang Lin},
journal= {arXiv preprint arXiv:2307.08476},
year = {2023}
}
备注
Accepted by ICCV 2023