基于空间与时间Transformer的3D人体姿态估计
计算机视觉与模式识别
2021-08-24 v3 人工智能
人机交互
摘要
Transformer架构已成为自然语言处理中的首选模型,现正被引入图像分类、目标检测与语义分割等计算机视觉任务。然而,在人体姿态估计领域,卷积架构仍占主导。本工作中,我们提出PoseFormer,一种纯基于Transformer、不涉及卷积架构的视频3D人体姿态估计方法。受视觉Transformer近期进展启发,我们设计了一种空间-时间Transformer结构,以全面建模每帧内的人体关节关系以及跨帧的时间相关性,进而输出中心帧的精确3D人体姿态。我们在两个流行且标准的基准数据集Human3.6M与MPI-INF-3DHP上对我们的方法进行了定量与定性评估。大量实验表明PoseFormer在两者上均达到了最先进(state-of-the-art)性能。代码见\url{https://github.com/zczcwh/PoseFormer}
引用
@article{arxiv.2103.10455,
title = {3D Human Pose Estimation with Spatial and Temporal Transformers},
author = {Ce Zheng and Sijie Zhu and Matias Mendieta and Taojiannan Yang and Chen Chen and Zhengming Ding},
journal= {arXiv preprint arXiv:2103.10455},
year = {2021}
}
备注
ICCV 2021