探索域自适应语义分割中跨域 Transformer 的一致性
计算机视觉与模式识别
2022-12-22 v3
摘要
尽管 Transformer 已大幅提升了语义分割性能,但域自适应 Transformer 尚未得到充分探索。我们指出域间隙会导致自注意力中的不一致性。由于该间隙,Transformer 会关注到虚假区域或像素,从而降低目标域上的精度。我们提出在注意力图上通过跨域注意力层进行自适应,该层在源域和目标域之间共享特征。具体而言,我们对跨域注意力与自注意力模块的输出施加一致性约束,以促使模型在跨域的注意力与输出上具有相似分布,即注意力级与输出级对齐。我们还对不同增强视图间的注意力图施加一致性约束,以进一步强化基于注意力的对齐。结合这两个组件,我们的方法缓解了跨域注意力图的不一致性,并在无监督域自适应设定下进一步提升了 Transformer 的性能。我们的模型在三个广泛使用的基准上优于现有最优基线模型,包括 GTAV-to-Cityscapes 平均提升 1.3 个百分点(pp)、Synthia-to-Cityscapes 提升 0.6 pp、Cityscapes-to-ACDC 提升 1.1 pp。此外,我们通过大量实验验证了方法的有效性与泛化性。我们的代码将公开可用。
引用
@article{arxiv.2211.14703,
title = {Exploring Consistency in Cross-Domain Transformer for Domain Adaptive Semantic Segmentation},
author = {Kaihong Wang and Donghyun Kim and Rogerio Feris and Kate Saenko and Margrit Betke},
journal= {arXiv preprint arXiv:2211.14703},
year = {2022}
}