中文

面向3D自监督手姿估计的不确定感知时空点云交互网络——UST-Hand

计算机视觉与模式识别 2026-05-19 v1 人机交互

摘要

手动标注准确的3D手姿极其费时费力。现有的自监督手姿估计方法利用输入图像与渲染输出之间的差异,或多视图一致性约束作为优化网络并逐步细化姿势精度的驱动力。然而,这些方法高度易受噪声伪标签影响,并忽视充分利用细粒度空间相关性的重要性,削弱了模型训练的稳定性。为此,我们提出UST-Hand,一种自监督学习框架,估计手姿的不确定性分布并构建概率点云特征空间,以实现复杂的时空关系建模。UST-Hand采用条件正规化流模型捕获手姿分布并抽样多样化假设,促进在噪声伪标签监督下的稳健学习。这些多假设被映射到统一的概率3D点云空间,用于多视图和时间特征交互,全面探索手部运动模式和细粒度空间相关性。在三个具有挑战性的数据集上的大量实验表明,UST-Hand实现了最先进的性能,相较于现有自监督方法在Mean Per Vertex Position Error (MPVPE)上提升最高可达37.8%。

关键词

引用

@article{arxiv.2605.17742,
  title  = {UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation},
  author = {Tianhao Han and Haoyang Zhang and Liang Xie and Haochen Chang and Kun Gao and Yuan Cheng and Pengfei Ren and Erwei Yin},
  journal= {arXiv preprint arXiv:2605.17742},
  year   = {2026}
}

备注

Accepted by CVPR 2026