中文

通过标准域方法提升 3D 人体姿态估计的高效泛化

计算机视觉与模式识别 2025-01-28 v1 人工智能

摘要

近期深度学习方法的发展显著提高了 3D 人体姿态估计 (HPE) 的性能。然而,源域与目标域之间的域间差异导致性能下降,这是泛化性的主要挑战, necessitating extensive data augmentation 和/或针对特定目标域进行微调。为此,我们提出一种新颖的标准域方法,将源域和目标域映射到统一的标准域,从而无需在目标域中进行额外微调。为构建标准域,我们引入一种标准化过程,以生成一种新的 2D-3D 姿态映射,确保 2D-3D 姿态一致性并简化 2D-3D 姿态模式,从而更高效地训练提升网络。标准化过程如下:(1) 在源域中,在标准域内训练提升网络;(2) 在目标域中,利用透视投影特性和已知相机内参,对输入 2D 姿态进行标准化处理。因此,可以直接将训练好的网络应用于目标域,而无需额外微调。在 various lifting networks 和公开数据集 (如 Human3.6M、Fit3D、MPI-INF-3DHP) 上的实验表明,所提出的方法在相同数据量下显著提升了跨数据集的泛化能力。

关键词

引用

@article{arxiv.2501.16146,
  title  = {Toward Efficient Generalization in 3D Human Pose Estimation via a Canonical Domain Approach},
  author = {Hoosang Lee and Jeha Ryu},
  journal= {arXiv preprint arXiv:2501.16146},
  year   = {2025}
}

备注

15 pages, 6 figures