改进手语的三维姿态估计
计算机视觉与模式识别
2023-08-21 v1
摘要
本工作解决单幅图像中的三维人体姿态重建问题。我们提出一种将前向运动学(FK)与神经网络相结合的方法,以确保快速且有效的三维姿态预测。姿态被表示为分层树/图,其节点对应于建模其物理极限的人体关节。给定图像中关键点的二维检测,我们使用神经网络将骨架提升为三维,以预测关节旋转和骨骼长度。这些预测随后通过使用在 PyTorch 中作为网络层实现的前向运动学层与骨骼约束相结合。结果是一种快速且准确的三维骨骼姿态估计方法。通过定量与定性评估,我们证明该方法在每关节位置误差和视觉外观方面均显著优于 MediaPipe。此外,我们展示了在不同数据集上的泛化能力。在仅使用 CPU 的情况下,PyTorch 中的实现每幅图像运行时间为 100-200 毫秒(包括 CNN 检测)。
引用
@article{arxiv.2308.09525,
title = {Improving 3D Pose Estimation for Sign Language},
author = {Maksym Ivashechkin and Oscar Mendez and Richard Bowden},
journal= {arXiv preprint arXiv:2308.09525},
year = {2023}
}