中文

构建用于以自我为中心的 3D 姿态估计的时空 Transformer

计算机视觉与模式识别 2022-06-13 v1 人工智能 机器学习

摘要

从图像中进行以自我为中心的 3D 人体姿态估计(HPE)具有挑战性,原因在于头戴式相机鱼眼视角带来的严重自遮挡和强畸变。尽管现有工作使用基于热图的中间表示来一定程度上对抗畸变并取得些许成功,但解决自遮挡仍是一个开放问题。在本工作中,我们利用过去帧的信息来引导我们基于自注意力的 3D HPE 估计流程——Ego-STAN。具体而言,我们构建了一个时空 Transformer 模型,该模型关注于语义丰富的基于卷积神经网络的特征图。我们还提出了特征图令牌:一组新的可学习参数,用于关注这些特征图。最后,我们在 xR-EgoPose 数据集上展示了 Ego-STAN 的优越性能,其整体平均每关节位置误差提升了 30.6%,同时与最先进水平相比参数减少了 22%。

关键词

引用

@article{arxiv.2206.04785,
  title  = {Building Spatio-temporal Transformers for Egocentric 3D Pose Estimation},
  author = {Jinman Park and Kimathi Kaai and Saad Hossain and Norikatsu Sumi and Sirisha Rambhatla and Paul Fieguth},
  journal= {arXiv preprint arXiv:2206.04785},
  year   = {2022}
}

备注

4 pages, Extended abstract, Joint International Workshop on Egocentric Perception, Interaction and Computing (EPIC) and Ego4D, IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR), 2022