中文

基于条件多视角祖先采样的无监督三维人体姿态估计

计算机视觉与模式识别 2026-05-18 v1

摘要

我们提出了一种无需三维监督即可从单视角估计三维人体姿态的方法。该方法的关键在于利用在大规模二维人体姿态数据集上预训练的运动扩散模型(MDM)的二维扩散先验。具体而言,我们将扩散模型的多视角祖先采样扩展到人体姿态的二维到三维提升任务中。为此,我们新提出了一种条件多视角祖先采样(cMAS)方法,该方法优化三维姿态,使其多视角投影遵循二维MDM噪声空间中的流形,同时约束三维姿态以匹配给定的二维姿态和人体解剖学约束。在Yoga数据集上的实验表明,与最先进的有监督和无监督三维姿态估计方法相比,我们的方法实现了更好的跨域性能,包括在无法获得三维监督的极端人体姿态上。代码可在以下链接获取:https://github.com/asaa0001/c-MAS。

关键词

引用

@article{arxiv.2605.15583,
  title  = {Unsupervised 3D Human Pose Estimation via Conditional Multi-view Ancestral Sampling},
  author = {Ryohei Goto and Takuya Fujihashi and Shunsuke Saruwatari and Fumio Okura},
  journal= {arXiv preprint arXiv:2605.15583},
  year   = {2026}
}

备注

International Conference on Automatic Face and Gesture Recognition (FG 2026), Oral