中文

SnapPose3D:基于扩散模型的单帧2D至3D人体姿态提升

计算机视觉与模式识别 2026-04-30 v1

摘要

深度歧义和关节不确定性是2D至3D提升方法在文献中获得准确人体姿态预测所面临的两个主要障碍。特别是,这些问题由2D关节位置引起,这些位置可映射到多个3D位置,从而导致多个可能的最终姿态。针对这些考虑,我们提出利用扩散模型的生成能力来预测多个假设并聚合为最终准确姿态。因此,我们引入SnapPose3D,一个在推理时采用确定性训练以去噪3D姿态的框架,条件为视觉上下文和2D姿态特征。SnapPose3D在推理时采用概率方法,通过从单位高斯分布中随机抽样生成多个假设。与大多数先前方法通过处理时间序列来解决姿态歧义不同,SnapPose3D将单帧作为输入,避免了跟踪问题,限制了计算成本、数据获取复杂度以及对在线实时应用的需求。我们在众所周知的3D人体姿态估计基准测试上广泛评估了SnapPose3D,显示其能够生成和聚合准确的假设,从而实现最先进的结果。

关键词

引用

@article{arxiv.2604.26620,
  title  = {SnapPose3D: Diffusion-Based Single-Frame 2D-to-3D Lifting of Human Poses},
  author = {Alessandro Simoni and Riccardo Catalini and Davide Di Nucci and Guido Borghi and Davide Davoli and Lorenzo Garattoni and Gianpiero Francesca and Yuki Kawana and Roberto Vezzani},
  journal= {arXiv preprint arXiv:2604.26620},
  year   = {2026}
}

备注

Accepted at ICPR 2026