KTPFormer:用于 3D 人体姿态估计的运动学与轨迹先验知识增强 Transformer
计算机视觉与模式识别
2024-04-03 v2
摘要
本文提出了一种新颖的运动学与轨迹先验知识增强 Transformer(KTPFormer),它克服了现有基于 Transformer 的 3D 人体姿态估计方法的缺陷,即其自注意力机制中 Q、K、V 向量的推导均基于简单的线性映射。我们提出了两个先验注意力模块,即运动学先验注意力(KPA)和轨迹先验注意力(TPA),以利用人体已知的解剖结构和运动轨迹信息,促进多头自注意力中全局依赖和特征的有效学习。KPA 通过构建运动学拓扑来建模人体的运动学关系,而 TPA 构建轨迹拓扑以学习跨帧的关节运动轨迹信息。通过引入具有先验知识的 Q、K、V 向量,这两个模块使 KTPFormer 能够同时对空间和时间相关性进行建模。在三个基准数据集(Human3.6M、MPI-INF-3DHP 和 HumanEva)上的大量实验表明,与 SOTA 方法相比,KTPFormer 取得了优越的性能。更重要的是,我们的 KPA 和 TPA 模块具有轻量级的即插即用设计,可以集成到各种基于 Transformer 的网络(即基于扩散的网络)中,仅需极小的计算开销增加即可提升性能。代码可在以下地址获取:https://github.com/JihuaPeng/KTPFormer。
引用
@article{arxiv.2404.00658,
title = {KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose Estimation},
author = {Jihua Peng and Yanghong Zhou and P. Y. Mok},
journal= {arXiv preprint arXiv:2404.00658},
year = {2024}
}
备注
Accepted by CVPR 2024,GitHub code:https://github.com/JihuaPeng/KTPFormer