平滑至关重要:用于域自适应语义分割的动量 Transformer
计算机视觉与模式识别
2022-03-16 v1
摘要
在 Vision Transformer 变体(ViTs)在计算机视觉取得巨大成功后,其在域自适应语义分割中也展现出巨大潜力。遗憾的是,将局部 ViTs 直接应用于域自适应语义分割并未带来预期提升。我们发现局部 ViTs 的缺陷源于在目标域的伪标签构建与特征对齐过程中生成的严重高频分量。这些高频分量使局部 ViTs 的训练非常不平滑并损害其可迁移性。本文中,我们引入低通滤波机制——动量网络,以平滑目标域特征与伪标签的学习动态。此外,我们提出一种动态差异度量,通过动态权重对齐源域与目标域分布以评估样本重要性。解决上述问题后,在 sim2real 基准上的大量实验表明所提方法优于最先进方法。我们的代码见 https://github.com/alpc91/TransDA
引用
@article{arxiv.2203.07988,
title = {Smoothing Matters: Momentum Transformer for Domain Adaptive Semantic Segmentation},
author = {Runfa Chen and Yu Rong and Shangmin Guo and Jiaqi Han and Fuchun Sun and Tingyang Xu and Wenbing Huang},
journal= {arXiv preprint arXiv:2203.07988},
year = {2022}
}