基于空间图阶注意力与时序身体感知 Transformer 的 3D 人体姿态估计
计算机视觉与模式识别
2025-05-05 v1
摘要
当前,Transformer 和图卷积网络(GCN)是 3D 人体姿态估计的主流技术。然而,基于 Transformer 的方法在用于骨架表示时忽略了关节间的空间邻域关系,或在骨架序列建模中忽略了局部关节运动的局部时序模式;而基于 GCN 的方法则常常忽略了对姿态特定表示的需求。为解决这些问题,我们提出了一种新方法,利用 GCN 的图建模能力,用多个不同阶的图来表示每个骨架,并结合新引入的图阶注意力模块,动态强调每个关节最具代表性的阶。随后,使用提出的时变身体感知 Transformer 进一步处理序列的空间特征,该 Transformer 在建模序列中全局身体特征依赖关系的同时,能感知关节的局部骨架间特征依赖关系。鉴于我们的 3D 姿态输出与序列中心的 2D 姿态对齐,我们改进了自注意力机制,使其能感知中心姿态,同时逐渐减弱对首尾姿态的关注。在 Human3.6m、MPIINF-3DHP 和 HumanEva-I 数据集上的大量实验证明了所提方法的有效性。代码和模型已在 Github 上公开。
引用
@article{arxiv.2505.01003,
title = {3D Human Pose Estimation via Spatial Graph Order Attention and Temporal Body Aware Transformer},
author = {Kamel Aouaidjia and Aofan Li and Wenhao Zhang and Chongsheng Zhang},
journal= {arXiv preprint arXiv:2505.01003},
year = {2025}
}
备注
16 pages, 9 figures, 7 tables