中文

HandMCM:基于多模态点云的 3D 手姿态估计对应状态空间模型

计算机视觉与模式识别 2026-04-07 v2

摘要

3D 手姿态估计,即准确估计 3D 人体手部关键点位置的任务,对于许多人机交互应用(如增强现实)至关重要。然而,该任务由于手部自遮挡以及因与物体交互而产生的遮挡,面临着显著的挑战。本文提出了 HandMCM 以解决这些挑战。我们的 HandMCM 是一种基于强大的状态空间模型(Mamba)的新方法。通过融合用于局部信息注入/过滤和对应建模的模块,提出的对应 Mamba 有效地学习了在各种遮挡场景下关键点之间高度动态的运动学拓扑。此外,通过整合多模态图像特征,我们增强了输入的鲁棒性和表征能力,从而实现更准确的手姿态估计。在三个基准数据集上的经验评估表明,我们的模型在各类场景下的性能显著优于当前最先进的方法,尤其在严重遮挡的场景表现尤为突出。这些结果凸显了该方法在实际应用中提升 3D 手姿态估计准确性和可靠性的潜力。

关键词

引用

@article{arxiv.2602.01586,
  title  = {HandMCM: Multi-modal Point Cloud-based Correspondence State Space Model for 3D Hand Pose Estimation},
  author = {Wencan Cheng and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2602.01586},
  year   = {2026}
}

备注

AAAI accepted