用于基于关键点的手势识别的 RGB 图像 3D 手部姿态与形状估计
计算机视觉与模式识别
2022-05-10 v2
摘要
从 2D 图像估计手部 3D 姿态是一个被广泛研究的问题,也是虚拟现实、增强现实和手势识别等多个现实应用的必要条件。目前,从单张 RGB 图像可以计算出合理的估计结果,特别是当使用多任务学习方法来迫使系统在确定手部姿态时考虑手部形状时。然而,根据用于表示手部的方法不同,在现实任务中的性能可能会显著下降,这表明需要稳定的描述才能获得令人满意的结果。在本文中,我们提出了一个基于关键点的端到端 3D 手部姿态与形状估计框架,并将其成功应用于手势识别任务作为案例研究。具体而言,在对图像进行归一化的预处理步骤之后,所提出的流程使用一个多任务语义特征提取器从 RGB 图像生成 2D 热力图和手部轮廓,一个视点编码器预测手部和相机视图参数,一个稳定手部估计器生成 3D 手部姿态和形状,以及一个损失函数在学习阶段联合指导所有组件。在一个 3D 姿态与形状估计基准数据集上进行了测试以评估所提出的框架,该框架取得了 SOTA 性能。我们的系统还在两个手势识别基准数据集上进行了评估,显著优于其他基于关键点的方法,表明它是一个有效的解决方案,能够为手部姿态和形状生成稳定的 3D 估计。
引用
@article{arxiv.2109.13879,
title = {3D Hand Pose and Shape Estimation from RGB Images for Keypoint-Based Hand Gesture Recognition},
author = {Danilo Avola and Luigi Cinque and Alessio Fagioli and Gian Luca Foresti and Adriano Fragomeni and Daniele Pannone},
journal= {arXiv preprint arXiv:2109.13879},
year = {2022}
}