中文

SkelFormer:使用骨骼 Transformer 的无标记 3D 姿态与形状估计

计算机视觉与模式识别 2024-04-22 v1

摘要

我们引入了 SkelFormer,一种用于多视角人体姿态和形状估计的新型无标记动作捕捉流水线。我们的方法首先使用在大规模自然数据上预训练的现成 2D 关键点估计器,以获得 3D 关节位置。接下来,我们设计了一个基于回归的逆向运动学骨骼 Transformer,将关节位置从严重噪声观测中映射到姿态和形状表示。该模块整合了关于姿态空间的先验知识,并在运行时推断完整的姿态状态。将 3D 关键点检测和逆向运动学问题分离,加上我们的骨骼 Transformer 学习到的具有表达力的表示,增强了我们的方法对未见噪声数据的泛化能力。我们在三个公开数据集上使用分布内和分布外设置评估了我们的方法,并观察到相对于先前工作的强劲性能。此外,消融实验证明了我们架构中每个模块的影响。最后,我们研究了我们的方法在处理噪声和严重遮挡时的性能,并发现相对于其他解决方案具有显著的鲁棒性。

关键词

引用

@article{arxiv.2404.12625,
  title  = {SkelFormer: Markerless 3D Pose and Shape Estimation using Skeletal Transformers},
  author = {Vandad Davoodnia and Saeed Ghorbani and Alexandre Messier and Ali Etemad},
  journal= {arXiv preprint arXiv:2404.12625},
  year   = {2024}
}

备注

12 pages, 8 figures