中文

一种可泛化的多视角三维人体姿态回归方法

计算机视觉与模式识别 2019-10-09 v2

摘要

尽管单目姿态估计方法在性能上取得了显著提升,并且具备泛化到未知环境的能力,但多视角(MV)方法在精度上往往落后,且特定于某些数据集。这主要归因于以下事实:(1)与真实世界的单视角(SV)数据集不同,MV数据集通常在受控环境中采集以获得精确的三维标注,无法涵盖所有真实世界的挑战;(2)模型参数是针对特定相机设置学习的。为缓解这些问题,我们提出一种两阶段方法来检测并估计三维人体姿态,将SV姿态检测与MV三维姿态估计分离。这种分离使我们能为正确的任务利用各自的数据集,即利用SV数据集构建鲁棒的姿态检测模型,利用MV数据集构建精确的MV三维回归模型。此外,我们的三维回归方法仅需三维姿态数据及其到各视角的投影来构建模型,从而无需从测试设置中收集标注数据。因此,我们的方法可通过在训练时根据测试时使用的相机设置将三维姿态投影到二维,轻松泛化到新环境。由于在测试时使用SV姿态检测器收集二维姿态,可能产生不准确的检测,我们对其特性进行建模并在训练时融入该信息。我们证明,融入检测器特性对于构建鲁棒的三维回归模型至关重要,且所得回归模型能很好地泛化到新的MV环境。我们的评估结果表明,该方法在Human3.6M数据集上取得了有竞争力的结果,并显著改进了首个由实时手术记录生成的MV临床数据集上的结果。

关键词

引用

@article{arxiv.1804.10462,
  title  = {A generalizable approach for multi-view 3D human pose regression},
  author = {Abdolrahim Kadkhodamohammadi and Nicolas Padoy},
  journal= {arXiv preprint arXiv:1804.10462},
  year   = {2019}
}

备注

The supplementary video is available at https://youtu.be/Cx_kTRzqqzA