中文

LiftFormer:基于注意力模型的 3D 人体姿态估计

计算机视觉与模式识别 2020-09-02 v1

摘要

估计人体关节的三维位置在过去几年中已成为广泛研究的课题。特别侧重于定义将二维数据(关键点)外推至 3D 的新方法,即预测关联于人骨架的关节的根相对坐标。最新研究趋势已证明 Transformer 编码器模块聚合时间信息显著优于以往方法。因此,我们提出使用这些模型,通过对视频中有序人体姿态序列运用注意力机制来利用时间信息,从而获得更精确的 3D 预测。在使用二维关键点预测器时,我们的方法在 Human3.6M 上以 0.3 mm(44.8 MPJPE,0.7% 提升)的优势持续优于文献中先前最佳结果,在使用真值输入时以 2 mm(MPJPE:31.9,8.4% 提升)优于先前结果。它还在 HumanEva-I 数据集上以 10.5 P-MPJPE(降低 22.2%)取得最先进性能。我们模型的参数量易于调节且更小(9.5M),小于当前方法(16.95M 与 11.25M),同时仍具更优性能。因而,我们的 3D 提升模型的精度超越其他端到端或 SMPL 方法,并与许多多视角方法相当。

关键词

引用

@article{arxiv.2009.00348,
  title  = {LiftFormer: 3D Human Pose Estimation using attention models},
  author = {Adrian Llopart},
  journal= {arXiv preprint arXiv:2009.00348},
  year   = {2020}
}

备注

9 pages, 2 figures