中文

PyCAT4:一种基于分层 Vision Transformer 的 3D 人体姿态估计框架

计算机视觉与模式识别 2026-05-27 v3 机器学习

摘要

近年来,通过将卷积神经网络(CNN)与金字塔网格对齐反馈环路相结合,3D 人体姿态估计的准确性取得了显著提升。此外,通过采用基于 Transformer 的时间分析架构,计算机视觉领域也取得了创新性突破。鉴于这些进展,本研究旨在深入优化和改进现有的 Pymaf 网络架构。本文的主要创新点包括:(1)引入基于自注意力机制的 Transformer 特征提取网络层,以增强对低级特征的捕获能力;(2)通过特征时间融合技术,增强对视频序列中时间信号的理解与捕获;(3)实现空间金字塔结构以完成多尺度特征融合,有效平衡不同尺度间的特征表示差异。本研究获得的新 PyCAT4 模型在 COCO 和 3DPW 数据集上进行了实验验证。结果表明,所提出的改进策略显著增强了网络在人体姿态估计中的检测能力,进一步推动了人体姿态估计技术的发展。

关键词

引用

@article{arxiv.2508.02806,
  title  = {PyCAT4: A Hierarchical Vision Transformer-based Framework for 3D Human Pose Estimation},
  author = {Zongyou Yang and Jonathan Loo and Yinghan Hou},
  journal= {arXiv preprint arXiv:2508.02806},
  year   = {2026}
}

备注

10 pages, 20 figures