中文

ASMa:用于骨架动作表示学习的非对称时空掩码

计算机视觉与模式识别 2026-02-09 v1 人工智能

摘要

自监督学习 (SSL) 在骨架基动作识别中通过利用数据增强来学习有意义的表示方面显示出显著的成功。然而,现有的 SSL 方法依赖的数据增强主要聚焦于掩码高运动帧和高程 (degree) 关节(如 degree 为 3 或 4 的关节),这导致偏差和不完整的特征表示,难以在 varied motion patterns 之间泛化。为此,我们提出 ASMa(Asymmetric Spatio-temporal Masking),用于骨架动作表示学习,这是一种新型的掩码组合,旨在学习人类动作固有的完整时空动力学。ASMa 采用两种互补的掩码策略:一种 selectively 掩码 high-degree 关节和 low-motion,另一种掩码 low-degree 关节和 high-motion 帧。这些掩码策略确保更平衡和全面的骨架表示学习。此外,我们引入可学习的特征对齐模块,以有效对齐来自两个掩码视图中学习的表示。为便于在资源受限的设置和低资源设备上部署,我们通过知识蒸馏将所学习并对齐的表示压缩为轻量级模型。广泛的实验在 NTU RGB+D 60、NTU RGB+D 120 和 PKU-MMD 数据集上表明,我们的方法在 fine-tuning 中优于现有的 SSL 方法,平均提升 2.7-4.4%;在 transfer learning 到 noisy 数据集时提升最高可达 5.9%,并在与 fully supervised 基线之间实现竞争性能。我们的蒸馏模型实现 91.4% 参数减少和 3 倍加速推理,同时保持竞争的准确率,使其在资源受限场景中实现实际部署。

关键词

引用

@article{arxiv.2602.06251,
  title  = {ASMa: Asymmetric Spatio-temporal Masking for Skeleton Action Representation Learning},
  author = {Aman Anand and Amir Eskandari and Elyas Rahsno and Farhana Zulkernine},
  journal= {arXiv preprint arXiv:2602.06251},
  year   = {2026}
}