中文

探索视觉Transformer中用于半监督语义分割的Token级数据增强

计算机视觉与模式识别 2025-03-11 v2

摘要

近年来,半监督语义分割取得了显著进展。然而,现有算法基于卷积神经网络,由于概念上的差异,将它们直接应用于视觉Transformer会带来一定的局限性。为此,我们提出了TokenMix,一种专门为基于视觉Transformer的半监督语义分割设计的数据增强技术。TokenMix通过在token级别混合图像,与全局注意力机制很好地对齐,增强了图像块之间上下文信息的学习能力。我们进一步结合了图像增强和特征增强以促进增强的多样性。此外,为了增强一致性正则化,我们提出了一个双分支框架,其中每个分支对输入图像应用图像和特征增强。我们在多个基准数据集上进行了广泛实验,包括Pascal VOC 2012、Cityscapes和COCO。结果表明,所提出的方法优于现有最先进算法,在有限精细标注下准确率提升尤为显著。

关键词

引用

@article{arxiv.2503.02459,
  title  = {Exploring Token-Level Augmentation in Vision Transformer for Semi-Supervised Semantic Segmentation},
  author = {Dengke Zhang and Quan Tang and Fagui Liu and Haiqing Mei and C. L. Philip Chen},
  journal= {arXiv preprint arXiv:2503.02459},
  year   = {2025}
}