D3PRefiner:一种基于扩散的去噪方法用于三维人体姿态细化
计算机视觉与模式识别
2024-01-09 v1
摘要
使用单目相机进行三维(3D)人体姿态估计因其易于实现和日常生活中可获取的丰富数据而受到越来越多的关注。然而,由于图像中固有的深度模糊性,现有基于单目相机的 3D 姿态估计方法的准确性仍不令人满意,估计出的 3D 姿态通常包含大量噪声。通过观察这种噪声的直方图,我们发现噪声的每个维度都遵循某种分布,这表明神经网络有可能学习噪声姿态与真实姿态之间的映射。在这项工作中,为了获得更准确的 3D 姿态,我们提出了一种基于扩散的 3D 姿态细化器(D3PRefiner)来细化任何现有 3D 姿态估计器的输出。我们首先引入一个条件多元高斯分布来对噪声 3D 姿态的分布进行建模,使用配对的 2D 姿态和噪声 3D 姿态作为条件以实现更高的准确性。此外,我们利用当前扩散模型的架构将噪声 3D 姿态的分布转换为真实 3D 姿态。为了评估所提出方法的有效性,我们使用两个最先进的序列到序列 3D 姿态估计器作为基础 3D 姿态估计模型,并在不同类型的 2D 姿态和不同长度的输入序列上评估所提出的方法。实验结果表明,所提出的架构可以显著提高当前序列到序列 3D 姿态估计器的性能,平均每关节位置误差(MPJPE)至少降低 10.3%,Procrustes MPJPE(P-MPJPE)至少降低 11.0%。
引用
@article{arxiv.2401.03914,
title = {D3PRefiner: A Diffusion-based Denoise Method for 3D Human Pose Refinement},
author = {Danqi Yan and Qing Gao and Yuepeng Qian and Xinxing Chen and Chenglong Fu and Yuquan Leng},
journal= {arXiv preprint arXiv:2401.03914},
year = {2024}
}