中文

改进手语的三维姿态估计

计算机视觉与模式识别 2023-08-21 v1

摘要

本工作解决单幅图像中的三维人体姿态重建问题。我们提出一种将前向运动学(FK)与神经网络相结合的方法,以确保快速且有效的三维姿态预测。姿态被表示为分层树/图,其节点对应于建模其物理极限的人体关节。给定图像中关键点的二维检测,我们使用神经网络将骨架提升为三维,以预测关节旋转和骨骼长度。这些预测随后通过使用在 PyTorch 中作为网络层实现的前向运动学层与骨骼约束相结合。结果是一种快速且准确的三维骨骼姿态估计方法。通过定量与定性评估,我们证明该方法在每关节位置误差和视觉外观方面均显著优于 MediaPipe。此外,我们展示了在不同数据集上的泛化能力。在仅使用 CPU 的情况下,PyTorch 中的实现每幅图像运行时间为 100-200 毫秒(包括 CNN 检测)。

关键词

引用

@article{arxiv.2308.09525,
  title  = {Improving 3D Pose Estimation for Sign Language},
  author = {Maksym Ivashechkin and Oscar Mendez and Richard Bowden},
  journal= {arXiv preprint arXiv:2308.09525},
  year   = {2023}
}