Transformer-CNN协同组:基于双学生最佳互补的半监督语义分割
计算机视觉与模式识别
2023-12-19 v2
摘要
半监督语义分割的流行方法大多采用基于卷积神经网络(CNNs)的单一网络模型,并强制模型对施加于输入或模型的扰动所做出的预测保持一致。然而,这种学习范式存在两个关键局限:a) 为无标签数据学习判别性特征;b) 从整幅图像中学习全局与局部信息。本文提出一种新颖的半监督学习(SSL)方法,称为Transformer-CNN协同组(TCC),其由两个学生组成,一个基于视觉Transformer(ViT),另一个基于CNN。我们的方法通过伪标签为无标签数据巧妙引入了预测上的多级一致性正则化以及异构特征空间。首先,由于ViT学生的输入为图像块,所提取的特征图编码了关键的类间统计信息。为此,我们提出类感知特征一致性蒸馏(CFCD),其首先利用每个学生的输出作为伪标签,并生成类感知特征(CF)图用于两学生间的知识迁移。其次,由于ViT学生对所有层具有更均匀的表示,我们提出一致性感知交叉蒸馏(CCD)以在协同组的像素级预测间迁移知识。我们在Cityscapes和Pascal VOC 2012数据集上验证了TCC框架,其大幅优于现有SSL方法。
引用
@article{arxiv.2209.02178,
title = {Transformer-CNN Cohort: Semi-supervised Semantic Segmentation by the Best of Both Students},
author = {Xu Zheng and Yunhao Luo and Chong Fu and Kangcheng Liu and Lin Wang},
journal= {arXiv preprint arXiv:2209.02178},
year = {2023}
}