(Fusionformer):基于 Transformer 的融合网络利用联合运动协同进行三维人体姿态估计
计算机视觉与模式识别
2022-11-01 v2 人工智能
摘要
针对当前三维人体姿态估计任务,一类方法主要从空间和时间相关性中学习 2D-3D 投影规则。然而,早期方法在时域中对整个身体关节的全局特征建模,却忽略了单个关节的运动轨迹。近期工作 [29] 考虑到不同关节间运动存在差异,并分别处理每个关节的时间关系。但我们发现,在特定动作下不同关节呈现出相同的运动趋势。因此,我们提出的 Fusionformer 方法在时空模块基础上引入了自轨迹模块和互轨迹模块。此后,全局时空特征与局部关节轨迹特征通过线性网络以并行方式融合。为消除不良 2D 姿态对 3D 投影的影响,最后我们还引入了姿态精化网络以平衡 3D 投影的一致性。此外,我们在两个基准数据集(Human3.6M、MPI-INF-3DHP)上评估了所提方法。将我们的方法与基线方法 poseformer 比较,结果显示在 Human3.6M 数据集上 MPJPE 和 P-MPJPE 分别提升了 2.4% 和 4.3%。
引用
@article{arxiv.2210.04006,
title = {(Fusionformer):Exploiting the Joint Motion Synergy with Fusion Network Based On Transformer for 3D Human Pose Estimation},
author = {Xinwei Yu and Xiaohua Zhang},
journal= {arXiv preprint arXiv:2210.04006},
year = {2022}
}