中文

2D 预训练用于 3D 姿态估计

计算机视觉与模式识别 2026-04-28 v1 机器学习

摘要

预训练是一种在多种深度学习任务中应用的通用方法。通过首先在一个任务上训练模型,然后进一步在用于最终评估的下游任务上进行训练,模型被迫学习对输入数据的更通用理解。虽然预训练已用于 3D 人体姿态估计(HPE)之前,但所用数据集的范围通常非常有限,仅限于一些强大的基准数据集,如 Human3.6M。因此,在本项目中,我们将现有的 3D HPE 方案扩展至兼容额外的 2D 和 3D HPE 数据集,如 Occlusion Person。我们对 2D 预训练的各个方面(如模型大小)如何影响下游性能进行了广泛研究,以及预训练在多大程度上有助于模型对不同数据集的泛化。实验结果表明,2D 预训练始终优于仅使用 3D 数据训练,尤其在计算效率方面。最后,借助 MPII 和 Human3.6M,我们能够获得低于 64.5mm 的 MPJPE 分数。

关键词

引用

@article{arxiv.2604.22830,
  title  = {2D Pre-Training for 3D Pose Estimation},
  author = {Liyao Jiang and Ruichen Chen and Keith G. Mills},
  journal= {arXiv preprint arXiv:2604.22830},
  year   = {2026}
}

备注

This work was completed as a graduate course project more than four years prior to this preprint. It is shared for archival and educational purposes. We open-source our code fork here: https://github.com/ECE740F21T01/pytorch-pose-hg-3d