中文

SegDA:基于伪标签的最大可分离片段掩码用于域自适应语义分割

计算机视觉与模式识别 2023-08-14 v1

摘要

无监督域自适应(UDA)旨在通过将知识从标注丰富的源域迁移来解决目标域标注稀缺的问题。通常,源域由合成图像组成,其标注可利用众所周知的计算机图形技术轻松获得。然而,为真实世界图像(目标域)获取标注需要大量人工标注工作且非常耗时,因为它要求逐像素标注。为解决该问题,我们提出 SegDA 模块,通过学习最大可分离片段表示来提升 UDA 方法的迁移性能。这解决了识别视觉相似类别(如行人/骑行者、人行道/道路等)的问题。我们借助受神经坍塌(Neural Collapse)启发的等角紧框架(ETF)分类器实现片段类别间的最大分离。这使得源域像素表示坍塌为单一向量,形成与最大可分离 ETF 分类器对齐的单形顶点。我们利用该现象提出一种用于目标域片段表示域自适应的新架构。此外,我们提出估计目标域图像标注中的噪声并更新解码器以进行噪声校正,从而促使发现伪标签中未标识类别的像素。我们使用了四个 UDA 基准,模拟合成到真实、白天到夜晚、晴朗到恶劣天气场景。我们提出的方法在 GTA -> Cityscapes 上超出 +2.2 mIoU,在 Synthia -> Cityscapes 上超出 +2.0 mIoU,在 Cityscapes -> DarkZurich 上超出 +5.9 mIoU,在 Cityscapes -> ACDC 上超出 +2.6 mIoU。

关键词

引用

@article{arxiv.2308.05851,
  title  = {SegDA: Maximum Separable Segment Mask with Pseudo Labels for Domain Adaptive Semantic Segmentation},
  author = {Anant Khandelwal},
  journal= {arXiv preprint arXiv:2308.05851},
  year   = {2023}
}

备注

11 pages, 4 Tables, 3 Figures, accepted at ICCVW 2023 (ICCV 2023: 4th Workshop on Visual Perception for Navigation in Human Environments)