中文

STGFormer:用于视频中 3D 人体姿态估计的时空图Transformer

计算机视觉与模式识别 2025-08-20 v2

摘要

当前的基于视频的 3D 人体姿态估计方法已取得显著进展。然而,它们仍面临以下紧迫挑战:在 Transformer 中 underutilize 利用时空身体结构特征,以及在图卷积网络中时空交互建模的 granularity 粒度不足,这导致单目 3D 人体姿态估计中普遍存在深度歧义。为此,本文提出了时空图Former框架(STGFormer),用于视频中的 3D 人体姿态估计。首先,我们引入时空十字图(STG)注意力机制,旨在更有效地利用人体在连续序列分布中固有的图先验,同时捕获时空长程依赖。接下来,我们提出双路径调制跳跃式常规图卷积神经网络(MHR-GCN),独立并行处理时维和空维,保留富含时序动态信息和原始或高维空间结构表示的特征。此外,该模块利用调制优化参数效率,并纳入时空跳跃式残差连接以捕获更高阶信息。最后,我们在 Human3.6M 和 MPIINF-3DHP 数据集上 demonstrate,该方法实现了最先进的性能。

关键词

引用

@article{arxiv.2407.10099,
  title  = {STGFormer: Spatio-Temporal GraphFormer for 3D Human Pose Estimation in Video},
  author = {Yang Liu and Zhiyong Zhang},
  journal= {arXiv preprint arXiv:2407.10099},
  year   = {2025}
}