中文

EPOCH:联合估计相机和人类的 3D 位姿

计算机视觉与模式识别 2024-07-01 v1 图形学 机器学习

摘要

单目人体姿态估计(HPE)旨在从单一 2D 图像中确定人体关节的 3D 位置。然而,图像中的单个 2D 点可能对应于 3D 空间中的多个点。通常,采用正交或弱透视相机模型来近似 2D-3D 关系的唯一性。本研究不再依赖近似,而是主张使用完整的透视相机模型。这包括估计相机参数并建立精确、无歧义的 2D-3D 关系。为此,我们引入EPOCH框架,包含两个主要组件:姿态提升网络(LiftNet)和姿态回归网络(RegNet)。LiftNet利用完整的透视相机模型以无监督方式精确估计 3D 位姿。它以 2D 位姿和相机参数为输入,产生相应的 3D 位姿估计。这些输入来自RegNet,该网络从单张图像开始,提供 2D 位姿和相机参数的估计。RegNet仅使用 2D 位姿数据作为弱监督。内部,RegNet预测 3D 位姿,然后利用估计的相机参数将其投影到 2D。这一过程使RegNet能够建立无歧义的 2D-3D 关系。我们的实验表明,模型化提升任务为无监督任务且相机参与其中,可实现对未见数据的更好泛化。我们在Human3.6M和MPI-INF-3DHP数据集上获得了 3D HPE 的最新结果。我们的代码已公开:[接受后链接,见补充材料]。

关键词

引用

@article{arxiv.2406.19726,
  title  = {EPOCH: Jointly Estimating the 3D Pose of Cameras and Humans},
  author = {Nicola Garau and Giulia Martinelli and Niccolò Bisagno and Denis Tomè and Carsten Stoll},
  journal= {arXiv preprint arXiv:2406.19726},
  year   = {2024}
}

备注

17 pages, 7 figures