用于语义分割的全卷积自适应网络
计算机视觉与模式识别
2018-04-24 v1
摘要
深度神经网络的最新进展已令人信服地展示了在大型数据集上学习视觉模型的高能力。然而,收集专家标注的数据集尤其是具有像素级标注的数据集是一个极其昂贵的过程。一个吸引人的替代方案是渲染合成数据(例如电脑游戏)并自动生成真值。然而,由于域偏移,直接将在合成图像上学习的模型应用于真实图像可能导致较高的泛化误差。本文从视觉外观级和表示级域自适应的角度缓解该问题。前者将源域图像调整为看似从目标域的“风格”中绘制,后者试图学习域不变表示。具体而言,我们提出全卷积自适应网络(FCAN),一种用于语义分割的新型深度架构,它结合了外观自适应网络(AAN)和表示自适应网络(RAN)。AAN 在像素空间中学习从一个域到另一个域的变换,RAN 以对抗学习方式进行优化,以用学习到的源和目标表示最大程度地欺骗域判别器。我们在从 GTA5(游戏视频)到 Cityscapes(城市街景)的语义分割迁移上进行了大量实验,与最先进(SOTA)的无监督自适应技术相比,我们的方案取得了优越结果。更值得注意的是,我们在无监督设定下于 BDDS(行车记录仪视频)上获得了新纪录:mIoU 达 47.5%。
引用
@article{arxiv.1804.08286,
title = {Fully Convolutional Adaptation Networks for Semantic Segmentation},
author = {Yiheng Zhang and Zhaofan Qiu and Ting Yao and Dong Liu and Tao Mei},
journal= {arXiv preprint arXiv:1804.08286},
year = {2018}
}
备注
CVPR 2018, Rank 1 in Segmentation Track of Visual Domain Adaptation Challenge 2017