学习用于域泛化城市场景分割的内容增强掩码Transformer
计算机视觉与模式识别
2023-12-19 v5
摘要
域泛化城市场景语义分割(USSS)旨在跨多样城市场景风格学习泛化的语义预测。与域间隙挑战不同,USSS的独特之处在于不同城市场景中的语义类别往往相似,而由于城市景观、天气条件、光照及其他因素的变化,风格可能存在显著差异。现有方法通常依赖卷积神经网络(CNNs)来学习城市场景的内容。本文中,我们提出一种用于域泛化USSS的内容增强掩码Transformer(CMFormer)。其核心思想是增强Transformer分割模型中基础组件——掩码注意力机制——对内容信息的关注。为此,我们引入一种新颖的内容增强掩码注意力机制。它从图像特征及其下采样对应特征中学习掩码查询,因为较低分辨率的图像特征通常包含更鲁棒的内容信息且对风格变化较不敏感。这些特征被融合进一个Transformer解码器,并整合到一个多分辨率内容增强掩码注意力学习方案中。在多个域泛化城市场景分割数据集上开展的广泛实验表明,所提CMFormer显著优于现有的基于CNN的域泛化语义分割方法,在mIoU(平均交并比)上取得了最高达14.00%的提升。源代码已公开于\url{https://github.com/BiQiWHU/CMFormer}。
引用
@article{arxiv.2307.00371,
title = {Learning Content-enhanced Mask Transformer for Domain Generalized Urban-Scene Segmentation},
author = {Qi Bi and Shaodi You and Theo Gevers},
journal= {arXiv preprint arXiv:2307.00371},
year = {2023}
}
备注
Accepted by AAAI 2024. Camera-ready version with available source code