一种用于城市场景语义分割的课程式领域自适应方法
计算机视觉与模式识别
2019-01-11 v3
摘要
在过去的半个十年中,卷积神经网络(CNNs)在语义分割上取得了压倒性优势,而语义分割是自动驾驶和增强现实等许多应用中的核心任务之一。然而,训练CNNs需要大量数据,这些数据难以收集且标注费力。计算机图形学的最新进展使得在具有计算机生成标注的照片级真实感合成图像上训练CNNs成为可能。尽管如此,真实图像与合成数据之间的领域失配阻碍了模型的性能。因此,我们提出一种课程式学习方法,以最小化城市场景语义分割中的领域差距。该课程式领域自适应先解决简单任务以推断关于目标领域的必要属性;具体而言,第一个任务是学习图像上的全局标签分布以及地标超像素上的局部分布。这些易于估计,因为城市场景图像具有强烈的特异性(例如,建筑物、街道、汽车等的大小与空间关系)。然后我们训练一个分割网络,同时将其在目标领域的预测正则化以遵循那些推断出的属性。在实验中,我们的方法在两个数据集和两种骨干网络上均优于基线方法。我们还报告了关于我们方法的广泛消融研究。
引用
@article{arxiv.1812.09953,
title = {A Curriculum Domain Adaptation Approach to the Semantic Segmentation of Urban Scenes},
author = {Yang Zhang and Philip David and Hassan Foroosh and Boqing Gong},
journal= {arXiv preprint arXiv:1812.09953},
year = {2019}
}
备注
This is the journal version of arXiv:1707.09465