探索视觉Transformer中用于半监督语义分割的Token级数据增强
计算机视觉与模式识别
2025-03-11 v2
摘要
近年来,半监督语义分割取得了显著进展。然而,现有算法基于卷积神经网络,由于概念上的差异,将它们直接应用于视觉Transformer会带来一定的局限性。为此,我们提出了TokenMix,一种专门为基于视觉Transformer的半监督语义分割设计的数据增强技术。TokenMix通过在token级别混合图像,与全局注意力机制很好地对齐,增强了图像块之间上下文信息的学习能力。我们进一步结合了图像增强和特征增强以促进增强的多样性。此外,为了增强一致性正则化,我们提出了一个双分支框架,其中每个分支对输入图像应用图像和特征增强。我们在多个基准数据集上进行了广泛实验,包括Pascal VOC 2012、Cityscapes和COCO。结果表明,所提出的方法优于现有最先进算法,在有限精细标注下准确率提升尤为显著。
引用
@article{arxiv.2503.02459,
title = {Exploring Token-Level Augmentation in Vision Transformer for Semi-Supervised Semantic Segmentation},
author = {Dengke Zhang and Quan Tang and Fagui Liu and Haiqing Mei and C. L. Philip Chen},
journal= {arXiv preprint arXiv:2503.02459},
year = {2025}
}