中文

利用几何感知自编码器桥接骨架格式从数十个数据集学习三维人体姿态估计

计算机视觉与模式识别 2023-01-02 v1

摘要

基于深度学习的三维人体姿态估计在大规模标注数据上训练时表现最佳,使得从多个数据集联合学习成为一个重要研究方向。这一尝试的一个障碍是不同数据集提供的骨架格式不同,即它们未标注同一组解剖学标志点。关于如何以这些差异标签最好地监督一个模型,先前研究很少。我们表明,简单地为不同骨架使用独立输出头会导致深度估计不一致以及跨骨架信息共享不足。作为补救,我们提出一种新颖的仿射组合自编码器(ACAE)方法,对标志点数量进行降维。所发现的潜在三维点捕获了骨架间的冗余,当用于一致性正则化时可增强信息共享。我们的方法扩展到极端多数据集设定,其中我们使用28个三维人体姿态数据集监督一个模型,该方法在一系列基准上优于先前工作,包括具有挑战性的3D Poses in the Wild (3DPW)数据集。我们的代码和模型可供研究使用。

关键词

引用

@article{arxiv.2212.14474,
  title  = {Learning 3D Human Pose Estimation from Dozens of Datasets using a Geometry-Aware Autoencoder to Bridge Between Skeleton Formats},
  author = {István Sárándi and Alexander Hermans and Bastian Leibe},
  journal= {arXiv preprint arXiv:2212.14474},
  year   = {2023}
}

备注

Accepted at the 2023 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV'23)