中文

HDFormer:用于三维人体姿态估计的高阶有向Transformer

计算机视觉与模式识别 2023-05-23 v2 人工智能

摘要

人体姿态估计因其结构化的数据序列特性而成为一项具有挑战性的任务。现有方法主要关注身体关节的成对交互,这在涉及关节重叠和姿态快速变化的场景中是不够的。为克服这些问题,我们提出了一种新颖的方法——高阶有向Transformer(HDFormer),它利用高阶骨骼和关节关系来改进姿态估计。具体而言,HDFormer融合了自注意力和高阶注意力,构建了一个多阶注意力模块。该模块促进了一阶“关节\leftrightarrow关节”、二阶“骨骼\leftrightarrow关节”以及高阶“超骨骼\leftrightarrow关节”的交互,有效解决了复杂和严重遮挡情况下的问题。此外,我们将现代CNN技术集成到基于Transformer的架构中,平衡了性能与效率之间的权衡。HDFormer在Human3.6M和MPI-INF-3DHP数据集上显著优于最先进(SOTA)模型,仅需1/10的参数量和显著降低的计算成本。此外,HDFormer展示了广泛的现实世界适用性,能够实现实时、准确的三维姿态估计。源代码见https://github.com/hyer/HDFormer

关键词

引用

@article{arxiv.2302.01825,
  title  = {HDFormer: High-order Directed Transformer for 3D Human Pose Estimation},
  author = {Hanyuan Chen and Jun-Yan He and Wangmeng Xiang and Zhi-Qi Cheng and Wei Liu and Hanbing Liu and Bin Luo and Yifeng Geng and Xuansong Xie},
  journal= {arXiv preprint arXiv:2302.01825},
  year   = {2023}
}

备注

Accepted to IJCAI 2023; 9 pages, 5 figures, 7 tables; the code is at https://github.com/hyer/HDFormer