中文

Skeletor:用于鲁棒人体姿态估计的骨骼 Transformer

计算机视觉与模式识别 2021-04-26 v1

摘要

从单目视频预测 3D 人体姿态可能极具挑战性,原因包括低分辨率、运动模糊和遮挡,以及从 2D 估计 3D 固有的歧义性。直接从独立图像回归 3D 姿态的方法尤其易受这些因素影响,导致骨骼估计中的抖动、噪声和/或不一致。若考虑场景与骨骼的时间演化,则多数问题可被克服。然而,我们并未跟踪身体部位并尝试对其时间平滑,而是提出了一种新颖的基于 transformer 的网络,能够以无监督方式学习姿态与运动上的分布。我们将该方法称为 Skeletor。Skeletor 克服了检测中的不准确性,并纠正部分或整体骨骼损坏。Skeletor 利用从 2500 万帧中学到的强先验,平滑且一致地纠正骨骼序列。Skeletor 之所以能做到这一点,是因为它通过基于 transformer 的神经网络隐式学习了人体运动的时空上下文。大量实验表明,Skeletor 在 3D 人体姿态估计上取得了改进性能,并进一步为手语翻译等下游任务带来益处。

关键词

引用

@article{arxiv.2104.11712,
  title  = {Skeletor: Skeletal Transformers for Robust Body-Pose Estimation},
  author = {Tao Jiang and Necati Cihan Camgoz and Richard Bowden},
  journal= {arXiv preprint arXiv:2104.11712},
  year   = {2021}
}