中文

具有分层时空去噪器的解耦扩散式 3D 人体姿态估计

计算机视觉与模式识别 2025-07-01 v2

摘要

最近,基于扩散的单目 3D 人体姿态估计方法通过直接从 2D 姿态序列回归 3D 关节坐标,实现了最先进 (SOTA) 的性能。虽然一些方法根据人体解剖骨骼将任务分解为骨长和骨方向预测,以显式 Incorporate 更多的人体先验约束,但这些方法的性能显著低于基于扩散的 SOTA 方法。这可归因于人体骨骼的树状结构。直接应用解耦方法可能会放大层级误差的累积,并通过每个层级传播。同时,先前方法尚未充分探索层级信息。为了解决这些问题,我们提出了一种具有分层时空去噪器的解耦扩散式 3D 人体姿态估计方法,称为 DDHPose。在我们的方法中:(1) 我们在扩散模型的前向过程中解耦 3D 姿态并扩散骨长和骨方向,以有效建模人体姿态先验。我们提出了一种解耦损失来监督扩散模型的学习。(2) 对于反向过程,我们提出了分层时空去噪器 (HSTDenoiser) 以改进每个关节的层级建模。我们的 HSTDenoiser 包含两个组件:层级相关空间变换器 (HRST) 和层级相关时间变换器 (HRTT)。HRST 利用关节空间信息以及父关节对每个关节的影响进行空间建模,而 HRTT 利用关节及其层级相邻关节的信息来探索关节间的层级时间相关性。代码和模型可在 https://github.com/Andyen512/DDHPose 获取。

关键词

引用

@article{arxiv.2403.04444,
  title  = {Disentangled Diffusion-Based 3D Human Pose Estimation with Hierarchical Spatial and Temporal Denoiser},
  author = {Qingyuan Cai and Xuecai Hu and Saihui Hou and Li Yao and Yongzhen Huang},
  journal= {arXiv preprint arXiv:2403.04444},
  year   = {2025}
}

备注

Accepted by AAAI24