中文

基于空间与时间Transformer的3D人体姿态估计

计算机视觉与模式识别 2021-08-24 v3 人工智能 人机交互

摘要

Transformer架构已成为自然语言处理中的首选模型,现正被引入图像分类、目标检测与语义分割等计算机视觉任务。然而,在人体姿态估计领域,卷积架构仍占主导。本工作中,我们提出PoseFormer,一种纯基于Transformer、不涉及卷积架构的视频3D人体姿态估计方法。受视觉Transformer近期进展启发,我们设计了一种空间-时间Transformer结构,以全面建模每帧内的人体关节关系以及跨帧的时间相关性,进而输出中心帧的精确3D人体姿态。我们在两个流行且标准的基准数据集Human3.6M与MPI-INF-3DHP上对我们的方法进行了定量与定性评估。大量实验表明PoseFormer在两者上均达到了最先进(state-of-the-art)性能。代码见\url{https://github.com/zczcwh/PoseFormer}

关键词

引用

@article{arxiv.2103.10455,
  title  = {3D Human Pose Estimation with Spatial and Temporal Transformers},
  author = {Ce Zheng and Sijie Zhu and Matias Mendieta and Taojiannan Yang and Chen Chen and Zhengming Ding},
  journal= {arXiv preprint arXiv:2103.10455},
  year   = {2021}
}

备注

ICCV 2021