面向高效通用特征预测的遮蔽骨架建模
计算机视觉与模式识别
2025-09-05 v1
摘要
近期在遮蔽自编码器(MAE)范式中取得的进展显著推动了基于骨架的人类动作识别。然而,大多数现有方法将重建目标限制在原始关节点坐标或其简单变体上,导致计算冗余且表征能力有限。为此,我们提出一种 novel General Feature Prediction 框架(GFP),用于高效遮蔽骨架建模。我们的关键创新在于用高层次特征预测取代常规的低层次重建,这些特征跨越从局部运动模式到全局语义表征。具体而言,我们引入一种协作学习框架,其中轻量级目标生成网络动态产生跨空间-时间层次结构的多样化监督信号,避免依赖预先计算的离线特征。该框架包含受约束的优化,以确保特征多样性并防止模型崩溃。在 NTU RGB+D 60、NTU RGB+D 120 和 PKU-MMD 上进行的实验表明,我们方法的优势:计算效率(比标准遮蔽骨架建模方法快 )和表征质量,实现了在各种下游任务中的 state-of-the-art 性能。
引用
@article{arxiv.2509.03609,
title = {Towards Efficient General Feature Prediction in Masked Skeleton Modeling},
author = {Shengkai Sun and Zefan Zhang and Jianfeng Dong and Zhiyong Cheng and Xiaojun Chang and Meng Wang},
journal= {arXiv preprint arXiv:2509.03609},
year = {2025}
}
备注
Accepted by ICCV 2025