C^2DA:对比式且上下文感知的域自适应语义分割
计算机视觉与模式识别
2024-10-29 v1 人工智能
摘要
无监督域自适应语义分割(UDA-SS)旨在使用源域数据(例如合成数据)训练模型,并在不获取目标域标注数据的情况下适配模型以预测目标域数据(例如真实场景)。大多数现有 UDA-SS 方法仅关注域间知识以缓解数据漂移问题,然而忽略了学习图像内在结构和探索两个域中像素分布的本质,这限制了 UDA-SS 方法能否达到类似监督学习的满意性能。此外,融合上下文知识也常被忽视。鉴于上述问题,本文提出一种 UDA-SS 框架,学习域内知识和上下文感知知识。为学习域内知识,我们在两个域中引入对比损失,该损失将相似类别的像素拉近,推远其他像素,从而促进像素级相关性。为学习上下文感知知识,我们修改了混合技术,利用类别之间的上下文依赖性。此外,我们采用掩码图像建模(MIM)技术,利用受限信息对受掩码图像的上下文线索进行稳健的视觉识别。全面实验验证,我们提出的方法在GTA-V->Cityscapes和Synthia->Cityscapes适配中的mIoU分别提升了0.51%和0.54%。我们开源了C2DA代码。代码链接:github.com/Masrur02/C-Squared-DA。
引用
@article{arxiv.2410.19748,
title = {C^2DA: Contrastive and Context-aware Domain Adaptive Semantic Segmentation},
author = {Md. Al-Masrur Khan and Zheng Chen and Lantao Liu},
journal= {arXiv preprint arXiv:2410.19748},
year = {2024}
}
备注
This paper has 16 pages, 6 figures, 5 tables. It has been accepted for publication at the International Symposium of Robotics Research (ISRR), Long Beach, California, USA, 2024