中文

LCR-Net++:自然图像中多人二维与三维姿态检测

计算机视觉与模式识别 2019-01-15 v3

摘要

我们提出了一种用于自然图像中联合二维与三维人体姿态估计的端到端架构。我们方法的关键在于为每幅图像生成并评分若干姿态候选框,从而能够同时预测多人的二维与三维姿态。因此,我们的方法不需要用人的近似定位来进行初始化。我们命名为 LCR-Net 的局部化-分类-回归架构包含三个主要组件:1)在图像不同位置提出候选姿态的姿态候选生成器;2)对不同的姿态候选进行评分的分类器;3)在二维与三维上细化姿态候选的回归器。所有三个阶段共享卷积特征层并联合训练。最终的姿态估计通过对邻近姿态假设进行积分得到,这被证明优于标准的非极大值抑制算法。我们的方法恢复全身的二维与三维姿态,在人物被部分遮挡或图像边界截断时 hallucinate(生成)出合理的身体部位。我们的方法在受控环境 Human3.6M 上的三维姿态估计显著优于当前最优(SOTA)方法。此外,它在 MPII 二维姿态基准的单人与多人子集的真实图像上展现出有前景的结果,并即使在多人图像上也展示出令人满意的三维姿态结果。

关键词

引用

@article{arxiv.1803.00455,
  title  = {LCR-Net++: Multi-person 2D and 3D Pose Detection in Natural Images},
  author = {Gregory Rogez and Philippe Weinzaepfel and Cordelia Schmid},
  journal= {arXiv preprint arXiv:1803.00455},
  year   = {2019}
}

备注

journal version of the CVPR 2017 paper, accepted to appear in IEEE Trans. PAMI