基于类感知跨域 Transformer 的一次性域自适应与可泛化语义分割
计算机视觉与模式识别
2022-12-15 v1
摘要
用于语义分割的无监督仿真到真实域自适应(UDA)旨在提升在仿真数据上训练模型在真实世界中的测试性能。它可节省机器人视觉与自动驾驶等真实应用中人工标注数据的成本。传统 UDA 常假设训练时有大量无标注真实世界数据样本可用于自适应。然而,由于采集困难与数据稀缺,该假设在实践中并非总成立。因此,我们旨在缓解对大量真实数据的需求,并探索一次性无监督仿真到真实域自适应(OSUDA)与泛化(OSDG)问题,其中仅有一个真实世界数据样本可用。为弥补有限的真实数据知识,我们首先通过用一次性真实数据对仿真数据进行风格化来构建伪目标域。为在风格与空间结构层面缓解仿真到真实域差距并促进仿真到真实自适应,我们进一步提出使用带中间域随机化策略的类感知跨域 Transformer,从仿真与伪目标数据中抽取域不变知识。我们在不同基准上展示了我们的方法对 OSUDA 与 OSDG 的有效性,大幅优于最先进方法,在 GTA、SYNTHIACityscapes、Foggy Cityscapes 上分别超出 10.87、9.59、13.05 与 15.91 mIoU。
引用
@article{arxiv.2212.07292,
title = {One-Shot Domain Adaptive and Generalizable Semantic Segmentation with Class-Aware Cross-Domain Transformers},
author = {Rui Gong and Qin Wang and Dengxin Dai and Luc Van Gool},
journal= {arXiv preprint arXiv:2212.07292},
year = {2022}
}
备注
15 pages, 6 figures, 10 Tables