中文

TokenPose:面向人体姿态估计的关键点令牌学习方法

计算机视觉与模式识别 2021-08-16 v3

摘要

人体姿态估计深度依赖于视觉线索与各部位间的解剖学约束来定位关键点。现有大多数基于CNN的方法在视觉表征方面表现良好,但缺乏显式学习关键点间约束关系的能力。本文提出一种基于令牌(Token)表征的人体姿态估计新方法(TokenPose)。具体而言,每个关键点被显式嵌入为一个令牌,以同时从图像中学习约束关系与外观线索。大量实验表明,小型与大型TokenPose模型在性能上与最先进的基于CNN的同类方法相当,同时更加轻量。具体而言,我们的TokenPose-S与TokenPose-L在COCO验证集上分别取得72.572.5 AP与75.875.8 AP,参数量显著降低(80.6%\downarrow80.6\%\downarrow 56.8%56.8\%),GFLOPs亦大幅下降(\downarrow 75.3%75.3\%\downarrow 24.7%24.7\%)。代码已公开可用。

关键词

引用

@article{arxiv.2104.03516,
  title  = {TokenPose: Learning Keypoint Tokens for Human Pose Estimation},
  author = {Yanjie Li and Shoukui Zhang and Zhicheng Wang and Sen Yang and Wankou Yang and Shu-Tao Xia and Erjin Zhou},
  journal= {arXiv preprint arXiv:2104.03516},
  year   = {2021}
}

备注

Accepted by ICCV'21. Code is publicly available at https://github.com/leeyegy/TokenPose