中文

利用 Transformer 学习序列上下文用于三维手姿态估计

计算机视觉与模式识别 2022-06-14 v2

摘要

三维手姿态估计(HPE)是从任意视觉输入中定位手部关节三维位置的过程。由于 HPE 在多种人机交互应用中的关键作用,近来受到了越来越多的关注。近期的 HPE 方法已展示了利用视频或多视角图像的优势,从而构建更鲁棒的 HPE 系统。据此,在本研究中,我们提出一种新方法,利用 Transformer 进行序列学习以估计手部姿态(SeTHPose)。我们的 SeTHPose 流程首先从单张手部图像中提取视觉嵌入。随后,我们使用 transformer 编码器沿时间或视角学习序列上下文,并生成准确的二维手部关节位置。接着,采用具有 U-Net 结构的图卷积神经网络将二维手部关节位置转换为三维姿态。我们的实验表明,SeTHPose 在时序与角向两类手部序列上均表现良好,并且在两个公开序列数据集 STB 和 MuViHand 上优于其他领域方法,取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2206.00171,
  title  = {Learning Sequential Contexts using Transformer for 3D Hand Pose Estimation},
  author = {Leyla Khaleghi and Joshua Marshall and Ali Etemad},
  journal= {arXiv preprint arXiv:2206.00171},
  year   = {2022}
}

备注

Accepted to ICPR'22