使用单目 RGB 的双手全局 3D 姿态估计
计算机视觉与模式识别
2020-08-26 v4
摘要
我们处理了仅通过单目 RGB 输入图像估计双手全局 3D 关节位置的挑战性任务。我们提出了一种新颖的基于多阶段卷积神经网络(CNN)的流水线,该流水线能够在双手之间存在遮挡和复杂背景噪声的情况下准确地分割和定位双手,并在没有任何深度信息的情况下估计 2D 和 3D 规范关节位置。使用手部姿态估计和关键骨骼的实际长度,通过一种新颖的投影算法计算相对于相机原点的全局关节位置。为了针对这一新任务训练 CNN,我们引入了一个大规模合成 3D 手部姿态数据集。我们证明了我们的系统在仅使用 RGB 信息的 3D 规范手部姿态估计基准数据集上优于先前的工作。此外,我们提出了首个使用纯 RGB 输入实现对双手精确全局 3D 手部追踪的工作,并提供了广泛的定量和定性评估。
引用
@article{arxiv.2006.01320,
title = {Two-hand Global 3D Pose Estimation Using Monocular RGB},
author = {Fanqing Lin and Connor Wilhelm and Tony Martinez},
journal= {arXiv preprint arXiv:2006.01320},
year = {2020}
}