中文

TriHorn-Net:一种基于深度图像的精确三维手姿估计模型

计算机视觉与模式识别 2022-06-28 v2

摘要

三维手姿估计方法近来已取得显著进展。然而,其估计精度往往远不足以满足特定现实应用的需求,因此仍有很大的改进空间。本文提出 TriHorn-Net,一种利用特定创新来提升深度图像上手姿估计精度的新模型。第一项创新是将三维手姿估计分解为深度图像空间(UV)中二维关节点位置的估计,以及在两张互补注意力图辅助下对应深度的估计。这种分解防止了难度更大的深度估计在预测和特征层面干扰 UV 估计。第二项创新是 PixDropout,据我们所知,这是首个基于外观的手部深度图像数据增强方法。实验结果表明,所提模型在三个公开基准数据集上优于当前最优(state-of-the-art)方法。我们的实现见 https://github.com/mrezaei92/TriHorn-Net。

关键词

引用

@article{arxiv.2206.07117,
  title  = {TriHorn-Net: A Model for Accurate Depth-Based 3D Hand Pose Estimation},
  author = {Mohammad Rezaei and Razieh Rastgoo and Vassilis Athitsos},
  journal= {arXiv preprint arXiv:2206.07117},
  year   = {2022}
}