中文

DAFormer:改进域自适应语义分割的网络架构与训练策略

计算机视觉与模式识别 2022-03-30 v2

摘要

由于获取真实世界图像的语义分割逐像素标注是一个昂贵的过程,因此可以转而使用更容易获取的合成数据训练模型,并在不需要真实图像标注的情况下将其适应于真实图像。这一过程在无监督域适应(UDA)中受到研究。尽管大量方法提出了新的适应策略,但它们大多基于过时的网络架构。由于近期网络架构的影响尚未得到系统研究,我们首先对UDA的不同网络架构进行了基准测试,并全新揭示了Transformer在UDA语义分割中的潜力。基于这些发现,我们提出了一种新颖的UDA方法DAFormer。DAFormer的网络架构由一个Transformer编码器和一个多级上下文感知特征融合解码器组成。它通过三种简单但关键的训练策略来稳定训练并避免对源域的过拟合:(1) 源域上的稀有类采样通过减轻自训练对常见类的确认偏差来提高伪标签的质量;(2) 物体类ImageNet特征距离与 (3) 学习率预热促进了从ImageNet预训练中的特征迁移。DAFormer代表了UDA的一项重大进展。它将GTA到Cityscapes的最先进水平提升了10.8 mIoU,将Synthia到Cityscapes提升了5.4 mIoU,并且能够很好地学习甚至诸如火车、公交车和卡车等困难类别。实现代码可在 https://github.com/lhoyer/DAFormer 获取。

关键词

引用

@article{arxiv.2111.14887,
  title  = {DAFormer: Improving Network Architectures and Training Strategies for Domain-Adaptive Semantic Segmentation},
  author = {Lukas Hoyer and Dengxin Dai and Luc Van Gool},
  journal= {arXiv preprint arXiv:2111.14887},
  year   = {2022}
}

备注

CVPR 2022