中文

用于集成2D和3D人体感知的深度多任务架构

计算机视觉与模式识别 2017-02-01 v1

摘要

我们提出一种深度多任务架构,用于单目图像中完全自动的2D和3D人体感知(DMHS),包括识别和重建。该系统计算前景-背景分割,在像素级语义识别人体部位,并估计人的2D和3D姿态。该模型通过多任务损失支持所有组件的联合训练,其中早期处理阶段递归地馈入高级阶段以进行日益复杂的计算、准确性和鲁棒性。该设计允许我们利用多个数据集来制定完整的训练协议,否则这些数据集将限制性地仅覆盖模型组件的一些:具有无身体部位标注且无关联3D真值的复杂2D图像数据,或具有有限2D背景变化的复杂3D数据。在基于几个具有挑战性的2D和3D数据集(LSP、HumanEva、Human3.6M)的详细实验中,我们评估了模型的子结构、多任务损失中各类训练数据的影响,并证明在所有处理级别均可达到最先进结果。我们还展示了在真实场景中,我们的单目RGB架构在感知上可与基于RGB-D数据的最先进(商业)Kinect系统竞争。

关键词

引用

@article{arxiv.1701.08985,
  title  = {Deep Multitask Architecture for Integrated 2D and 3D Human Sensing},
  author = {Alin-Ionut Popa and Mihai Zanfir and Cristian Sminchisescu},
  journal= {arXiv preprint arXiv:1701.08985},
  year   = {2017}
}