面向多人运动捕捉的神经场景分解
计算机视觉与模式识别
2019-03-15 v1
摘要
学习通用图像表示已被证明是许多计算机视觉任务成功的关键。例如,许多图像理解问题的方法依赖于最初在ImageNet上训练的深度网络,主要因为这些学习到的特征是从有限标注数据中学习的有价值起点。然而,在多人的3D运动捕捉方面,这些特征用途有限。因此,本文提出一种学习对此目的有用的特征的方法。为此,我们引入一种自监督方法以学习我们称之为神经场景分解(NSD)的表示,其可用于3D姿态估计。NSD包含三层抽象来表示人体主体:以边界框和相对深度表示的空间布局;以实例分割掩码表示的2D形状表示;以及主体特定的外观与3D姿态信息。通过利用多视角数据带来的自监督,我们的NSD模型可在无任何2D或3D监督下端到端训练。与先前方法不同,它适用于多人和全帧图像。由于编码了3D几何,NSD可有效用于从少量标注数据训练3D姿态估计网络。
引用
@article{arxiv.1903.05684,
title = {Neural Scene Decomposition for Multi-Person Motion Capture},
author = {Helge Rhodin and Victor Constantin and Isinsu Katircioglu and Mathieu Salzmann and Pascal Fua},
journal= {arXiv preprint arXiv:1903.05684},
year = {2019}
}
备注
CVPR 2019