中文

基于形状概念深度监督的遮挡感知三维物体解析

计算机视觉与模式识别 2017-04-24 v3

摘要

单目三维物体解析在包括遮挡推理和整体场景解释在内的多种场景中极受青睐。我们提出一种深度卷积神经网络 (CNN) 架构,用于在给定单张 RGB 图像的情况下,定位 2D 图像和 3D 空间中的语义部件,同时推断其可见性状态。我们的核心见解是利用领域知识通过深度监督其隐藏层来正则化网络,从而顺序推断与最终任务相关的中间概念。为了获取带有真实 3D 形状和相关概念所需数量的训练数据,我们渲染 3D 物体 CAD 模型以生成大规模合成数据,并模拟物体间具有挑战性的遮挡配置。我们仅在合成数据上训练网络,并在真实图像基准测试上展示了最先进的性能,这些基准包括 KITTI 的扩展版本、PASCAL VOC、PASCAL3D+ 和 IKEA,用于 2D 和 3D 关键点定位与实例分割。实证结果通过展示从合成数据到真实图像的有效知识迁移,证实了我们的深度监督方案的效用,与标准端到端训练相比减少了过拟合。

关键词

引用

@article{arxiv.1612.02699,
  title  = {Deep Supervision with Shape Concepts for Occlusion-Aware 3D Object Parsing},
  author = {Chi Li and M. Zeeshan Zia and Quoc-Huy Tran and Xiang Yu and Gregory D. Hager and Manmohan Chandraker},
  journal= {arXiv preprint arXiv:1612.02699},
  year   = {2017}
}

备注

Accepted in CVPR 2017