中文

HiPART:用于遮挡三维人体姿态估计的分层姿态自回归Transformer

计算机视觉与模式识别 2025-04-01 v1 机器学习

摘要

现有的2D到3D人体姿态估计(HPE)方法通过丰富提升阶段的时间线索和视觉线索等信息来应对遮挡问题。本文认为,这些方法忽略了稀疏骨架2D输入表示的限制,这从根本上限制了2D到3D的提升并加剧了遮挡问题。为解决这些问题,我们提出了一种新颖的两阶段生成式致密化方法,称为分层姿态自回归Transformer(HiPART),从原始稀疏2D姿态生成分层2D密集姿态。具体来说,我们首先开发了一个多尺度骨架标记化模块,将高度密集的2D姿态量化为分层标记,并提出了骨架感知对齐(Skeleton-aware Alignment)以增强标记连接。然后,我们开发了一种分层自回归建模方案用于分层2D姿态生成。以生成的分层姿态作为2D到3D提升的输入,所提方法在遮挡场景中表现出强鲁棒性,并在基于单帧的3D HPE上达到了最先进性能。此外,它在降低参数和计算复杂度的同时优于众多多帧方法,并且还可以补充这些方法以进一步增强性能和鲁棒性。

关键词

引用

@article{arxiv.2503.23331,
  title  = {HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation},
  author = {Hongwei Zheng and Han Li and Wenrui Dai and Ziyang Zheng and Chenglin Li and Junni Zou and Hongkai Xiong},
  journal= {arXiv preprint arXiv:2503.23331},
  year   = {2025}
}

备注

CVPR2025