中文

面向城市场景语义分割的课程式域适应

计算机视觉与模式识别 2018-11-15 v5 机器学习

摘要

在过去的五年里,卷积神经网络 (CNN) 在语义分割这一自动驾驶等众多应用的核心任务上取得了巨大成功。然而,训练 CNN 需要大量数据,这些数据难以收集且标注费力。计算机图形学的最新进展使得利用计算机生成的标注在照片级逼真的合成图像上训练 CNN 成为可能。尽管如此,真实图像与合成数据之间的域不匹配严重削弱了模型的性能。因此,我们提出一种课程式学习方法,以最小化城市场景语义分割中的域差距。该课程式域适应首先解决简单任务,以推断目标域的必要属性;具体而言,第一个任务是学习图像上的全局标签分布和地标性超像素上的局部分布。这些任务易于估计,因为城市场景图像具有很强的独特性(例如,建筑物、街道、汽车等的尺寸和空间关系)。然后,我们训练一个分割网络,同时正则化其在目标域的预测以遵循这些推断出的属性。在实验中,我们的方法在两个数据集和两种骨干网络上均优于基线方法。我们还报告了关于我们方法的广泛消融研究。

关键词

引用

@article{arxiv.1707.09465,
  title  = {Curriculum Domain Adaptation for Semantic Segmentation of Urban Scenes},
  author = {Yang Zhang and Philip David and Boqing Gong},
  journal= {arXiv preprint arXiv:1707.09465},
  year   = {2018}
}

备注

This is the extended version of the ICCV 2017 paper "Curriculum Domain Adaptation for Semantic Segmentation of Urban Scenes" with additional GTA experiment