中文

AMPose:用于三维人体姿态估计的交替混合全局-局部注意力模型

计算机视觉与模式识别 2023-11-01 v5 多媒体

摘要

图卷积网络(GCNs)已被用于建模人体关节间物理连接与非局部关系以进行三维人体姿态估计(HPE)。此外,纯基于Transformer的模型近期在基于视频的三维HPE中展现出有前景的结果。然而,单帧方法仍需建模关节间的物理连接关系,因为仅通过Transformer的全局关系变换得到的特征表示忽略了人体骨架信息。为解决该问题,我们提出一种新方法,将Transformer编码器和GCN块交替堆叠,即AMPose,以结合关节间的全局与物理连接关系用于HPE。在AMPose中,Transformer编码器用于连接每个关节与所有其他关节,而GCNs用于捕获物理连接关系信息。我们在Human3.6M数据集上评估了所提方法的有效性。我们的模型通过在MPI-INF-3DHP数据集上测试也展现出更好的泛化能力。代码可在 https://github.com/erikervalid/AMPose 获取。

关键词

引用

@article{arxiv.2210.04216,
  title  = {AMPose: Alternately Mixed Global-Local Attention Model for 3D Human Pose Estimation},
  author = {Hongxin Lin and Yunwei Chiu and Peiyuan Wu},
  journal= {arXiv preprint arXiv:2210.04216},
  year   = {2023}
}

备注

ICASSP 2023 Accepted Paper