中文

CrossFormer:用于三维人体姿态估计的跨时空 Transformer

计算机视觉与模式识别 2022-03-28 v1

摘要

三维人体姿态估计可通过编码身体部位之间的几何依赖关系并施加运动学约束来处理。近来,Transformer 已被用于编码空间和时间域中关节之间的长程依赖关系。尽管它们在长程依赖方面表现出色,但研究指出需要改进视觉 Transformer 的局部性。在此方向上,我们提出了一种新颖的姿态估计 Transformer,其具有对身体关节的丰富表示,这对于捕捉跨帧的细微变化(即帧间特征表示)至关重要。具体而言,通过两个新颖的交互模块——跨关节交互(Cross-Joint Interaction)与跨帧交互(Cross-Frame Interaction),该模型显式编码了身体关节之间的局部和全局依赖关系。所提出的架构在两个流行的三维人体姿态估计数据集 Human3.6 和 MPI-INF-3DHP 上取得了最先进的性能。特别是,我们提出的 CrossFormer 方法相较于最接近的同类方法 PoseFormer,在使用检测到的二维姿态和真实标注设置下分别将性能提升了 0.9% 和 0.3%。

关键词

引用

@article{arxiv.2203.13387,
  title  = {CrossFormer: Cross Spatio-Temporal Transformer for 3D Human Pose Estimation},
  author = {Mohammed Hassanin and Abdelwahed Khamiss and Mohammed Bennamoun and Farid Boussaid and Ibrahim Radwan},
  journal= {arXiv preprint arXiv:2203.13387},
  year   = {2022}
}