中文

用于语义图像分割的领域自适应与泛化网络架构及训练策略

计算机视觉与模式识别 2023-09-28 v2

摘要

无监督领域自适应(UDA)与领域泛化(DG)使在源领域训练的机器学习模型能在未标注甚至未见的目标领域上表现良好。由于先前的 UDA&DG 语义分割方法大多基于过时的网络,我们对更近期的架构进行了基准测试,揭示了 Transformer 的潜力,并设计了专为 UDA&DG 定制的 DAFormer 网络。它通过三种训练策略避免对源领域过拟合:其中(1)稀有类采样缓解了向常见源领域类的偏置,(2)物体类 ImageNet 特征距离与(3)学习率预热促进了从 ImageNet 预训练的特征迁移。由于 UDA&DG 通常耗费大量 GPU 显存,多数先前方法对图像进行下采样或裁剪。然而,低分辨率预测常无法保留精细细节,而以裁剪图像训练的模型难以捕捉长程、领域鲁棒上下文信息。因此,我们提出 HRDA,一种用于 UDA&DG 的多分辨率框架,它结合了小尺寸高分辨率裁剪保留精细分割细节与大尺寸低分辨率裁剪通过学习的尺度注意力捕捉长程上下文依赖的优势。DAFormer 与 HRDA 在 5 个不同基准上以超过 10 mIoU 显著改进了最先进的 UDA&DG。实现代码见 https://github.com/lhoyer/HRDA。

关键词

引用

@article{arxiv.2304.13615,
  title  = {Domain Adaptive and Generalizable Network Architectures and Training Strategies for Semantic Image Segmentation},
  author = {Lukas Hoyer and Dengxin Dai and Luc Van Gool},
  journal= {arXiv preprint arXiv:2304.13615},
  year   = {2023}
}

备注

TPAMI 2023. arXiv admin note: text overlap with arXiv:2111.14887, arXiv:2204.13132