面向鲁棒语义分割的全局平均特征增强技术
计算机视觉与模式识别
2024-12-17 v2
摘要
对分布外数据的数据鲁棒性是部署现代神经网络的关键。最近,诸如 SegFormer 等 Vision Transformer 在语义分割任务中展现出对视觉损坏(如模糊或噪声)的强大鲁棒性。本文提出一种称为通道级特征增强(CWFA)的简单高效特征增强技术,以提高 Vision Transformer 在语义分割任务中的鲁棒性。CWFA 在训练期间对每个编码器应用全局估计的扰动,计算开销最小。我们在 Cityscapes 和 ADE20K 数据集上进行了广泛评估,测试了三种最新的 Vision Transformer 架构:SegFormer、Swin Transformer 和 Twins。实验表明,CWFA 增强模型在不影响干净数据性能的前提下显著提高了鲁棒性。例如,在 Cityscapes 上,CWFA 增强的 SegFormer-B1 模型在冲击噪声下可实现最高 27.7% 的 mIoU 鲁棒性提升。此外,CWFA 增强的 SegFormer-B5 达到了新的 state-of-the-art 84.3% 的保留率,比最近的 FAN+STL 高出 0.7%。
引用
@article{arxiv.2412.01941,
title = {Global Average Feature Augmentation for Robust Semantic Segmentation with Transformers},
author = {Alberto Gonzalo Rodriguez Salgado and Maying Shen and Philipp Harzig and Peter Mayer and Jose M. Alvarez},
journal= {arXiv preprint arXiv:2412.01941},
year = {2024}
}