中文

HRDA:上下文感知的高分辨率域自适应语义分割

计算机视觉与模式识别 2022-07-27 v2

摘要

无监督域自适应(UDA)旨在将源域(如合成数据)上训练的模型自适应到目标域(如真实世界数据),而无需目标域上的进一步标注。本工作聚焦于语义分割的 UDA,因为真实世界像素级标注尤其昂贵。由于语义分割的 UDA 方法通常占用大量 GPU 内存,多数先前方法仅在下采样图像上运行。我们质疑这一设计,因为低分辨率预测常无法保留精细细节。以高分辨率图像的随机裁剪进行训练的替代方案缓解了此问题,但未能捕捉长距离、对域鲁棒的上下文信息。因此,我们提出 HRDA,一种用于 UDA 的多分辨率训练方法,它结合小尺寸高分辨率裁剪(保留精细分割细节)与大尺寸低分辨率裁剪(捕捉长距离上下文依赖)的优势,并通过学习的尺度注意力融合,同时保持可控的 GPU 内存占用。HRDA 能够自适应小物体并保留精细分割细节。它将 GTA-to-Cityscapes 的 SOTA 性能显著提升 5.5 mIoU,将 Synthia-to-Cityscapes 提升 4.9 mIoU,分别达到前所未有的 73.8 和 65.8 mIoU。实现代码见 https://github.com/lhoyer/HRDA。

关键词

引用

@article{arxiv.2204.13132,
  title  = {HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic Segmentation},
  author = {Lukas Hoyer and Dengxin Dai and Luc Van Gool},
  journal= {arXiv preprint arXiv:2204.13132},
  year   = {2022}
}

备注

ECCV 2022