中文

基于扩散的三维人体姿态估计与多假设聚合

计算机视觉与模式识别 2023-08-24 v2

摘要

本文提出一种新颖的基于扩散的三维姿态估计(D3DP)方法,结合基于逐关节重投影的多假设聚合(JPMA),用于概率性三维人体姿态估计。一方面,D3DP 为单个 2D 观测生成多个可能的 3D 姿态假设。它逐步将真实 3D 姿态扩散至随机分布,并学习以 2D 关键点为条件的去噪器以恢复无污染的 3D 姿态。所提 D3DP 兼容现有 3D 姿态估计器,并支持用户通过两个可定制参数在推理时权衡效率与精度。另一方面,提出 JPMA 将 D3DP 生成的多个假设组装为单个 3D 姿态以供实际使用。它将 3D 姿态假设重投影至 2D 相机平面,基于重投影误差逐关节选取最佳假设,并将所选关节组合为最终姿态。所提 JPMA 在关节级别进行聚合并利用 2D 先验信息,这两点均被以往方法忽视。在 Human3.6M 与 MPI-INF-3DHP 数据集上的大量实验表明,我们的方法分别优于最先进的确定性与概率性方法 1.5% 与 8.9%。代码见 https://github.com/paTRICK-swk/D3DP。

关键词

引用

@article{arxiv.2303.11579,
  title  = {Diffusion-Based 3D Human Pose Estimation with Multi-Hypothesis Aggregation},
  author = {Wenkang Shan and Zhenhua Liu and Xinfeng Zhang and Zhao Wang and Kai Han and Shanshe Wang and Siwei Ma and Wen Gao},
  journal= {arXiv preprint arXiv:2303.11579},
  year   = {2023}
}

备注

ICCV 2023