HGFreNet:用于3D人体姿态估计的跳跃混合图Transformer,频域动力学一致性
计算机视觉与模式识别
2025-11-04 v1
摘要
2D至3D的人体姿态提升是单目视频中3D人体姿态估计的基本挑战,图卷积网络(GCN)和注意力机制已被证明适合编码骨骼关节的空间-时间相关性。然而,2D姿态估计中的深度歧义和误差导致3D轨迹不连贯。以往研究尝试限制时间域中的抖动,例如通过约束相邻帧之间的差异,却忽略了骨骼关节运动的全局空间-时间相关性。为此,我们设计HGFreNet,一种具有跳跃混合特征聚合和频域3D轨迹一致性的新型GraphFormer架构。具体而言,我们提出了跳跃混合图注意力(HGA)模块和Transformer编码器,用于建模全局关节空间-时间相关性。HGA模块将骨骼关节的所有k-hop邻居分组为混合组,以扩大感受野并应用注意力机制全局发现这些组的潜在相关性。随后,我们通过约束频域中的轨迹一致性来利用全局时间相关性。为提供跨帧的深度推理信息并维持时间连贯性,应用初步网络估计3D姿态。在Human3.6M和MPI-INF-3DHP两个标准基准数据集上进行了广泛实验。结果表明,HGFreNet在位置精度和时间一致性方面均优于当前最先进(SOTA)方法。
关键词
引用
@article{arxiv.2511.01756,
title = {HGFreNet: Hop-hybrid GraphFomer for 3D Human Pose Estimation with Trajectory Consistency in Frequency Domain},
author = {Kai Zhai and Ziyan Huang and Qiang Nie and Xiang Li and Bo Ouyang},
journal= {arXiv preprint arXiv:2511.01756},
year = {2025}
}