中文

面向人体姿态估计的复合定位

计算机视觉与模式识别 2021-05-18 v1 人工智能

摘要

现有人体姿态估计方法由于学习目标复杂,面临长距离回归不准确或计算成本高的问题。本文提出一种称为复合定位的新型深度学习框架用于人体姿态估计,将复杂的学习目标分解为两个更简单的目标:用稀疏热图找到关键点的近似位置,用两个短距离偏移图获得其最终精确坐标。为实现该框架,我们构建了两类复合定位网络:CLNet-ResNet 和 CLNet-Hourglass。我们在三个基准数据集上评估这些网络,包括 Leeds Sports Pose 数据集、MPII Human Pose 数据集和 COCO 关键点检测数据集。实验结果表明,我们的 CLNet-ResNet50 以约 1/2 GFLOPs 的计算量比 SimpleBaseline 高出 1.14%。我们的 CLNet-Hourglass 在 COCO 上比原始 stacked-hourglass 高出 4.45%。

关键词

引用

@article{arxiv.2105.07245,
  title  = {Composite Localization for Human Pose Estimation},
  author = {ZiFan Chen and Xin Qin and Chao Yang and Li Zhang},
  journal= {arXiv preprint arXiv:2105.07245},
  year   = {2021}
}