FastDDHPose:面向统一、高效、无层级误差累积的 3D 人体姿态估计
计算机视觉与模式识别
2025-12-17 v1
摘要
单摄像头 3D 人体姿态估计 (3D HPE) 的最近方法通过直接从 2D 关键点序列回归 3D 姿态实现了领先性能。尽管 3D HPE 领域取得了快速进展,但现有方法通常在差异化框架下进行训练和评估,缺乏统一框架进行公平比较。为此,我们提出Fast3DHPE,一个模块化框架,促进新方法的快速复现和灵活开发。通过标准化训练和评估协议,Fast3DHPE 实现了 3D 人体姿态估计方法之间的公平比较,同时显著提高了训练效率。在此框架内,我们引入FastDDHPose,这是一种基于解耦扩散的 3D 人体姿态估计方法,利用扩散模型强大的潜在分布建模能力,显式建模骨长和骨向的分布,同时避免进一步放大层级误差累积。此外,我们设计了高效的运动学-层级空间和时间去噪器,鼓励模型关注运动学关节层次结构,同时避免对过于复杂的关节拓扑进行不必要的建模。在 Human3.6M 和 MPI-INF-3DHP 上进行大量实验表明,Fast3DHPE 框架实现了所有方法的公平比较,同时显著提高了训练效率。在统一框架内,FastDDHPose 实现了最先进的性能,在野外场景中表现出强大的泛化和鲁棒性。该框架和模型将发布于:https://github.com/Andyen512/Fast3DHPE
引用
@article{arxiv.2512.14162,
title = {FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation},
author = {Qingyuan Cai and Linxin Zhang and Xuecai Hu and Saihui Hou and Yongzhen Huang},
journal= {arXiv preprint arXiv:2512.14162},
year = {2025}
}