中文

HDiffTG:用于3D人体姿态估计的轻量级混合Diffusion-Transformer-GCN架构

计算机视觉与模式识别 2025-05-08 v1 多媒体

摘要

我们提出了HDiffTG,一种将Transformer、图卷积网络(GCN)和扩散模型整合到统一框架中的新型3D人体姿态估计(3DHPE)方法。HDiffTG利用这些技术的优势,在保持轻量级设计的同时显著提高了姿态估计的准确性和鲁棒性。Transformer捕捉全局时空依赖关系,GCN对局部骨骼结构进行建模,而扩散模型提供逐步优化以进行微调,实现了全局与局部特征之间的互补平衡。这种整合增强了模型在遮挡和复杂场景下处理姿态估计的能力。此外,我们对整合后的模型引入了轻量级优化,并改进了目标函数设计,在不牺牲性能的情况下减少了计算开销。在Human3.6M和MPI-INF-3DHP数据集上的评估结果表明,HDiffTG在MPI-INF-3DHP数据集上取得了SOTA性能,同时在准确性和计算效率方面均表现出色。此外,该模型在噪声和遮挡环境中展现出卓越的鲁棒性。源代码和模型可在 https://github.com/CirceJie/HDiffTG 获取。

关键词

引用

@article{arxiv.2505.04276,
  title  = {HDiffTG: A Lightweight Hybrid Diffusion-Transformer-GCN Architecture for 3D Human Pose Estimation},
  author = {Yajie Fu and Chaorui Huang and Junwei Li and Hui Kong and Yibin Tian and Huakang Li and Zhiyuan Zhang},
  journal= {arXiv preprint arXiv:2505.04276},
  year   = {2025}
}

备注

8 pages, 4 figures, International Joint Conference on Neural Networks (IJCNN)