MotionAGFormer:利用Transformer-GCNFormer网络增强三维人体姿态估计
计算机视觉与模式识别
2023-10-26 v1
摘要
近期基于Transformer的方法在三维人体姿态估计中展现出优异性能。然而,它们具有整体视角,通过编码所有关节间的全局关系,未能精确捕捉局部依赖。本文提出一种新颖的注意力-GCNFormer(AGFormer)块,通过使用两个并行的Transformer与GCNFormer流来分割通道数。我们提出的GCNFormer模块利用相邻关节间的局部关系,输出一种对Transformer输出互补的新表示。通过自适应融合这两种表示,AGFormer展现出更好学习底层三维结构的能力。通过堆叠多个AGFormer块,我们提出四种不同变体的MotionAGFormer,可基于速度-精度权衡进行选择。我们在两个流行基准数据集Human3.6M与MPI-INF-3DHP上评估模型。MotionAGFormer-B取得最先进结果,P1误差分别为38.4mm与16.2mm。值得注意的是,其参数量仅为之前领先模型在Human3.6M数据集上的四分之一,且计算效率高三倍。代码与模型见https://github.com/TaatiTeam/MotionAGFormer。
引用
@article{arxiv.2310.16288,
title = {MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network},
author = {Soroush Mehraban and Vida Adeli and Babak Taati},
journal= {arXiv preprint arXiv:2310.16288},
year = {2023}
}