中文

HSTFormer:用于三维人体姿态估计的分层时空 Transformer

计算机视觉与模式识别 2023-01-19 v1

摘要

基于 Transformer 的方法已成功提出用于从二维姿态序列进行三维人体姿态估计(HPE)并取得了最先进(SOTA)性能。然而,当前 SOTA 方法难以同时建模不同层级关节的时空相关性。这是由于姿态的时空复杂性所致。姿态暂时以不同速度运动,空间上涉及不同关节与身体部位的移动。因此,一刀切的 Transformer 缺乏适应性,难以满足“真实场景”需求。为缓解此问题,我们提出分层时空 Transformer(HSTFormer),从局部到全局逐步捕捉多级关节的时空相关性,以实现准确的三维 HPE。HSTFormer 由四个 Transformer 编码器(TE)和一个融合模块组成。据我们所知,HSTFormer 首个研究了具有多级融合的分层 TE。在三个数据集(即 Human3.6M、MPI-INF-3DHP 和 HumanEva)上的大量实验表明,HSTFormer 在各种规模和难度的基准上取得了有竞争力且一致的性能。具体而言,它以高度泛化的系统化方法在具有挑战性的 MPI-INF-3DHP 数据集和小规模 HumanEva 数据集上超越了近期 SOTA。代码见:https://github.com/qianxiaoye825/HSTFormer。

关键词

引用

@article{arxiv.2301.07322,
  title  = {HSTFormer: Hierarchical Spatial-Temporal Transformers for 3D Human Pose Estimation},
  author = {Xiaoye Qian and Youbao Tang and Ning Zhang and Mei Han and Jing Xiao and Ming-Chun Huang and Ruei-Sung Lin},
  journal= {arXiv preprint arXiv:2301.07322},
  year   = {2023}
}

备注

The first two authors have equal contribution