中文

作为组合令牌的人体姿态

计算机视觉与模式识别 2023-03-22 v1

摘要

人体姿态通常由身体关节的坐标向量或其热图嵌入表示。尽管便于数据处理,但由于缺乏关节间的依赖建模,会得出不真实的姿态估计。本文提出一种结构化表示,称为作为组合令牌的姿态(Pose as Compositional Tokens, PCT),以探索关节依赖性。它将一个姿态表示为 M 个离散令牌,每个令牌刻画一个包含若干相互依赖关节的子结构。该组合设计使其能以较小代价实现低重建误差。随后我们将姿态估计视为分类任务。具体而言,我们学习一个分类器从图像中预测 M 个令牌的类别。一个预学习的译码网络用于从令牌恢复姿态,无需进一步后处理。我们表明,在一般场景下其姿态估计结果优于或媲美现有方法,且在普遍存在的遮挡情况下仍表现良好。代码与模型已公开于 https://github.com/Gengzigang/PCT。

关键词

引用

@article{arxiv.2303.11638,
  title  = {Human Pose as Compositional Tokens},
  author = {Zigang Geng and Chunyu Wang and Yixuan Wei and Ze Liu and Houqiang Li and Han Hu},
  journal= {arXiv preprint arXiv:2303.11638},
  year   = {2023}
}

备注

Accepted by CVPR2023