中文

PandaNet:基于锚点的单阶段多人三维姿态估计

计算机视觉与模式识别 2021-01-08 v1

摘要

近来,已有若干深度学习模型被提出用于三维人体姿态估计。然而,这些方法大多仅关注单人情形,或仅在高分辨率下估计少数人的三维姿态。此外,诸如自动驾驶或人群分析等许多应用需要对可能处于低分辨率的大量人员进行姿态估计。在本文中,我们提出 PandaNet(基于姿态估计与检测锚点的网络,Pose estimAtioN and Dectection Anchor-based Network),一种新颖的单阶段、基于锚点且多人的三维姿态估计方法。所提模型执行边界框检测,并对每个被检测的人进行二维与三维姿态回归,全部在单次前向传播中完成。由于网络为每个边界框预测完整的三维姿态,其无需任何后处理来重新 grouping 关节,并允许对可能大量的低分辨率人员进行姿态估计。为处理人员重叠,我们引入一种姿态感知锚点选择策略。此外,由于图像中不同人员尺度存在不平衡,且关节坐标的不确定性随这些尺度而不同,我们提出一种自动优化与不同人员尺度和关节相关权重的方法以实现高效训练。PandaNet 在多个具有挑战性的数据集上超越了以往的单阶段方法:一个多人城市场景虚拟但非常真实的数据集(JTA Dataset),以及两个真实世界三维多人数据集(CMU Panoptic 和 MuPoTS-3D)。

关键词

引用

@article{arxiv.2101.02471,
  title  = {PandaNet : Anchor-Based Single-Shot Multi-Person 3D Pose Estimation},
  author = {Abdallah Benzine and Florian Chabot and Bertrand Luvison and Quoc Cong Pham and Cahterine Achrd},
  journal= {arXiv preprint arXiv:2101.02471},
  year   = {2021}
}