中文

基于双流时空 GCN-Transformer 的 3D 人体姿态估计

计算机视觉与模式识别 2026-04-21 v1

摘要

3D 人体姿态估计是计算机视觉领域的经典且重要的研究方向。近年来,基于 Transformer 的方法在将 2D 升至 3D 人体姿态估计方面取得了显著进展。然而,这些方法主要关注建模全局时空关系,忽略了局部骨骼关系以及不同通道之间的信息交互。因此,我们提出了一种新方法,即 Dual-stream Spatio-temporal GCN-Transformer 网络(MixTGFormer)。该方法通过两个平行通道同时建模人体骨骼的空间和时序关系,实现了全局特征和局部特征的有效融合。MixTGFormer 的核心由堆叠的 Mixformers 组成。具体而言,Mixformer 包括 Mixformer 块和 Squeeze-and-Excitation 层(SE 层)。它首先通过两个具有不同模式的 Mixformer 块提取并融合人体骨骼的各种信息,然后通过 SE 层进一步补充融合后的信息。Mixformer 块将图卷积网络(GCN)集成到 Transformer 中,增强了局部和全局信息的利用。此外,我们进一步实现了其时空形式,以提取空间和时序关系。我们在两个基准数据集(Human3.6M 和 MPI-INF-3DHP)上广泛评估了我们的模型。实验结果显示,与其他方法相比,我们的 MixTGFormer 在这些数据集上实现了最先进的结果,分别在 P1 上的误差为 37.6mm 和 15.7mm。

关键词

引用

@article{arxiv.2604.17688,
  title  = {Dual-stream Spatio-Temporal GCN-Transformer Network for 3D Human Pose Estimation},
  author = {Jiawen Duan and Jian Xiang and Zhiqiang Li and Linlin Xue and Wan Xiang},
  journal= {arXiv preprint arXiv:2604.17688},
  year   = {2026}
}

备注

Published in Displays, Vol. 93, 2026, Article 103429. DOI: https://doi.org/10.1016/j.displa.2026.103429 Free access: https://authors.elsevier.com/a/1mnPTWHUHYdGQ