中文

MaskSem:语义引导的掩码学习3D混合高阶运动表示

计算机视觉与模式识别 2025-08-19 v1

摘要

人类动作识别是智能机器人中的关键任务,尤其是在人机协作研究中。在基于自监督骨架的动作识别中,基于掩码的重建范式通过掩码关节并从无标签数据中重建目标来学习骨架的空间结构和运动模式。然而,现有方法仅关注有限的关节集合和低阶运动模式,限制了模型理解复杂运动模式的能力。为此,我们提出MaskSem,这是一种用于学习3D混合高阶运动表示的新型语义引导掩码方法。该新框架利用基于相对运动的Grad-CAM指导关节掩码,作为最语义丰富的时序区域。语义引导的掩码过程可鼓励模型探索更具辨识力的特征。此外,我们提出使用混合高阶运动作为重建目标,使模型能够学习多阶运动模式。具体而言,同时使用低阶运动速度和高阶运动加速度作为重建目标。该方法为动态运动过程提供了更全面的描述,增强了模型对运动模式的理解。在NTU60、NTU120和PKU-MMD数据集上的实验表明,MaskSem结合vanilla transformer可提高骨架基准的动作识别效果,使其更适用于人机交互的应用。

关键词

引用

@article{arxiv.2508.12948,
  title  = {MaskSem: Semantic-Guided Masking for Learning 3D Hybrid High-Order Motion Representation},
  author = {Wei Wei and Shaojie Zhang and Yonghao Dang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2508.12948},
  year   = {2025}
}

备注

Accepted to IROS 2025