中文

增强现实遇上计算机视觉:面向城市场景的高效数据生成

计算机视觉与模式识别 2017-08-07 v1

摘要

深度学习在计算机视觉领域的成功依赖于大规模标注数据集的可用性。为降低对手工标注图像的需求,虚拟渲染的3D世界近来日益流行。创建逼真的3D内容本身极具挑战性,且需要大量人力投入。在本工作中,我们提出一种替代范式,将真实数据与合成数据相结合,用于学习语义实例分割和物体检测模型。利用并非场景所有方面对该任务同等重要这一事实,我们提出用目标类别的虚拟物体来增强真实世界图像。大规模采集真实世界图像简单且成本低廉,并能直接提供真实的背景外观,而无需创建复杂的环境3D模型。我们提出了一种高效的程序,将虚拟物体增强到真实图像中。这使我们能够创建逼真的合成图像,既展现真实的背景外观,又包含大量复杂的物体排布。与建模完整的3D环境相比,我们的增强方法仅需少量用户交互以及目标物体的3D形状。通过大量实验,我们总结出能最大程度提升实例分割模型性能的增强数据生成参数。此外,我们展示了该方法在训练用于室外驾驶场景中汽车语义实例分割和物体检测的标准深度模型上的实用性。我们在经像素级精确真值标注的KITTI 2015数据集和Cityscapes数据集上测试了基于增强数据训练的模型。实验表明,基于增强图像训练的模型比基于合成数据或有限标注真实数据训练的模型具有更好的泛化能力。

关键词

引用

@article{arxiv.1708.01566,
  title  = {Augmented Reality Meets Computer Vision : Efficient Data Generation for Urban Driving Scenes},
  author = {Hassan Abu Alhaija and Siva Karthik Mustikovela and Lars Mescheder and Andreas Geiger and Carsten Rother},
  journal= {arXiv preprint arXiv:1708.01566},
  year   = {2017}
}