中文

MixSTE:用于视频中 3D 人体姿态估计的序列到序列混合时空编码器

计算机视觉与模式识别 2022-04-26 v4

摘要

近期,基于 Transformer 的解决方案被引入,通过全局考虑所有帧中的身体关节点来学习时空相关性,从而从 2D 关键点序列估计 3D 人体姿态。我们观察到不同关节的运动差异显著。然而,先前的方法无法有效地为每个关节建立稳固的帧间对应关系,导致时空相关性学习不足。我们提出了 MixSTE(混合时空编码器),它包含一个时间 Transformer 块来分别建模每个关节的时间运动,以及一个空间 Transformer 块来学习关节间的空间相关性。这两个块交替使用,以获得更好的时空特征编码。此外,网络输出从中心帧扩展到输入视频的所有帧,从而提高了输入和输出序列之间的一致性。在三个基准数据集(Human3.6M、MPI-INF-3DHP 和 HumanEva)上进行了大量实验。结果表明,我们的模型在 P-MPJPE 和 MPJPE 指标上分别比最先进的方法高出 10.9% 和 7.6%。代码可在 https://github.com/JinluZhang1126/MixSTE 获取。

关键词

引用

@article{arxiv.2203.00859,
  title  = {MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video},
  author = {Jinlu Zhang and Zhigang Tu and Jianyu Yang and Yujin Chen and Junsong Yuan},
  journal= {arXiv preprint arXiv:2203.00859},
  year   = {2022}
}

备注

CVPR2022 Accepted Paper