中文

用于自我中心热图到 3D 姿态提升的注意力传播网络

计算机视觉与模式识别 2024-02-29 v1

摘要

我们提出了 EgoTAP,一种用于高精度立体自我中心 3D 姿态估计的热图到 3D 姿态提升方法。自我中心相机视角中严重的自遮挡和肢体出界使得精确的姿态估计成为一个具有挑战性的问题。为了应对这一挑战,先前的方法采用了联合热图——身体姿态的概率 2D 表示,但热图到 3D 姿态的转换仍然是一个不精确的过程。我们提出了一种新颖的热图到 3D 提升方法,由 Grid ViT 编码器和传播网络组成。Grid ViT 编码器使用自注意力将联合热图总结为有效的特征嵌入。然后,传播网络通过利用骨骼信息来更好地估计模糊关节的位置,从而估计 3D 姿态。我们的方法在定性和定量上显著优于先前的最先进技术,MPJPE 指标误差降低了 23.9%。我们的源代码可在 GitHub 上获取。

关键词

引用

@article{arxiv.2402.18330,
  title  = {Attention-Propagation Network for Egocentric Heatmap to 3D Pose Lifting},
  author = {Taeho Kang and Youngki Lee},
  journal= {arXiv preprint arXiv:2402.18330},
  year   = {2024}
}

备注

16 pages, 9 figures, to be published as CVPR 2024 paper