基于上下文表征学习的双流 Transformer-GCN 模型用于单目 3D 人体姿态估计
计算机视觉与模式识别
2025-04-03 v1 人工智能
摘要
本文提出一种新颖的方法,用于单目 3D 人体姿态估计,基于上下文表征学习的 Transformer-GCN 双流模型。单目 3D 人体姿态估计面临深度歧义、有限 3D 标注训练数据、模型不平衡以及受限模型泛化等挑战。为解决这些限制,我们的方法引入了基于上下文表征学习的创造性运动预训练方法。具体而言,我们的方法涉及对 2D 姿态特征进行遮蔽,并利用 Transformer-GCN 双流模型在自教 setup 下学习高维表征。通过关注上下文表征学习和时空建模,我们的方法增强了模型理解姿态之间时空关系的能力,从而实现更好的泛化。此外,利用 Transformer-GCN 双流模型,我们的方法有效平衡了视频姿态估计中的全局与局部相互作用。该模型自适应地整合了 Transformer 与 GCN 流的信息,其中 GCN 流有效学习相邻关键点和帧之间的局部关系,而 Transformer 流捕获全面的全局时空特征。我们的模型在两个基准数据集上实现了最先进的性能,在 Human3.6M 上的 MPJPE 为 38.0mm,P-MPJPE 为 31.9mm,在 MPI-INF-3DHP 上的 MPJPE 为 15.9mm。此外,针对公开数据集和野外视频的可视化实验表明了我们方法的鲁棒性和泛化能力。
引用
@article{arxiv.2504.01764,
title = {Dual-stream Transformer-GCN Model with Contextualized Representations Learning for Monocular 3D Human Pose Estimation},
author = {Mingrui Ye and Lianping Yang and Hegui Zhu and Zenghao Zheng and Xin Wang and Yantao Lo},
journal= {arXiv preprint arXiv:2504.01764},
year = {2025}
}