中文

UniPose: 面向RGB-D数据的统一跨模态姿态先验传播用于弱监督3D人体姿态估计

计算机视觉与模式识别 2025-09-30 v1

摘要

在本文中,我们提出UniPose,一种面向使用无标注单视角RGB-D序列(RGB、深度和点云数据)进行弱监督3D人体姿态估计(HPE)的统一跨模态姿态先验传播方法。UniPose通过在对易获取的RGB-D序列上进行自监督学习,将大规模RGB数据集(如MS COCO)中的2D HPE标注传递到3D领域,消除了对劳动密集型3D关键点标注的需求。该方法弥合了2D和3D领域之间的差距,且不受多视角相机标定或合成到真实数据偏移相关问题的困扰。在训练过程中,UniPose利用现成的2D姿态估计作为点云网络的弱监督,结合身体对称性和关节运动等时空约束。2D到3D的反投影损失和跨模态交互进一步增强了这一过程。通过将点云网络的3D HPE结果视为伪真实标签,我们的锚点到关节预测方法对RGB和深度网络执行3D提升,使其相比最先进方法对2D HPE结果的不准确性更具鲁棒性。在CMU Panoptic和ITOP数据集上的实验表明,UniPose达到了与全监督方法相当的性能。纳入大规模无标注数据(如NTU RGB+D 60)增强了其在挑战性条件下的性能,展示了其实际应用潜力。我们提出的3D提升方法也取得了最先进的结果。

关键词

引用

@article{arxiv.2509.23376,
  title  = {UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation},
  author = {Jinghong Zheng and Changlong Jiang and Jiaqi Li and Haohong Kuang and Hang Xu and Tingbing Yan},
  journal= {arXiv preprint arXiv:2509.23376},
  year   = {2025}
}

备注

Accept at PRCV 2025