中文

统一域自适应语义分割

计算机视觉与模式识别 2025-10-06 v5 人工智能 图像与视频处理

摘要

无监督域自适应语义分割(Unsupervised Domain Adaptive Semantic Segmentation, UDA-SS)旨在将带标签源域的监督迁移至无标签目标域。现有UDA-SS工作大多考虑图像,而近期尝试通过建模时间维度进一步处理视频。尽管这两类研究共享主要挑战——克服潜在的域分布偏移,但它们的研究在很大程度上相互独立,导致见解碎片化、缺乏整体理解,并错失思想交叉融合的机会。这种碎片化阻碍了方法的统一,造成冗余努力及图像与视频域间次优的知识迁移。基于此观察,我们主张统一视频与图像场景下的UDA-SS研究,以实现更全面的理解、协同推进与高效知识共享。为此,我们从通用数据增强视角探索统一UDA-SS,将其作为统一概念框架,提升泛化能力,并具思想交叉融合潜力,最终助推该领域的整体进展与实际影响。具体而言,我们提出四向混合(Quad-directional Mixup, QuadMix)方法,其特征是通过特征空间中用于域内与域间混合的四向路径,处理不同点属性与特征不一致性。为应对视频的时间偏移,我们引入光流引导的跨空间与时间维度特征聚合,以实现细粒度域对齐。大量实验表明,我们的方法在四个具挑战性的UDA-SS基准上大幅优于最先进(sota)工作。我们的源代码与模型将发布于https://github.com/ZHE-SAPI/UDASS。

关键词

引用

@article{arxiv.2311.13254,
  title  = {Unified Domain Adaptive Semantic Segmentation},
  author = {Zhe Zhang and Gaochang Wu and Jing Zhang and Xiatian Zhu and Dacheng Tao and Tianyou Chai},
  journal= {arXiv preprint arXiv:2311.13254},
  year   = {2025}
}

备注

34 pages (main paper and supplementary material), 25 figures, 19 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025