中文

基于共识优化的相机坐标系下三维人体姿态估计

计算机视觉与模式识别 2021-08-23 v3

摘要

三维人体姿态估计常被视为估计相对于根身体关节的三维姿态的任务。作为替代,我们提出了一种相机坐标系下的三维人体姿态估计方法,其允许有效结合二维标注数据与三维姿态,并可直接推广至多视角情形。为此,我们将该问题表述为视锥空间姿态估计,其中绝对深度预测与关节相对深度估计被解耦。最终的相机坐标系三维预测通过逆相机投影获得。在此基础上,我们还提出了一种针对来自未标定图像的多视角预测的基于共识的优化算法,其仅需单次单目训练流程。尽管我们的方法与训练相机内参间接相关,其仍可对具有不同内参的相机收敛,得到一致至一个尺度因子的估计。我们的方法在知名三维人体姿态数据集上改进了当前最优(SOTA)水平,在最常用基准上将预测误差降低了 32%。我们还以绝对姿态位置误差报告了结果,单目估计平均达 80~mm,多视角平均达 51~mm。

关键词

引用

@article{arxiv.1911.09245,
  title  = {Consensus-based Optimization for 3D Human Pose Estimation in Camera Coordinates},
  author = {Diogo C Luvizon and Hedi Tabia and David Picard},
  journal= {arXiv preprint arXiv:1911.09245},
  year   = {2021}
}

备注

Source code is available at https://github.com/dluvizon/3d-pose-consensus