中文

半监督视觉Transformer

计算机视觉与模式识别 2022-07-19 v2

摘要

我们研究视觉 Transformer 用于半监督图像分类的训练。Transformer 最近在大量监督学习任务上展示了令人印象深刻的性能。令人惊讶的是,我们表明当只有少量标记数据可用时,视觉 Transformer 的表现明显差于卷积神经网络。受此观察启发,我们引入了一个联合半监督学习框架 Semiformer,它包含一个 transformer 流、一个卷积流以及一个精心设计的用于这些流之间知识共享的融合模块。卷积流在有限的标记数据上训练,并进一步用于生成伪标签以监督 transformer 流在无标记数据上的训练。在 ImageNet 上的大量实验表明,Semiformer 达到了 75.5% 的 top-1 准确率,以明显优势优于最先进水平。此外,我们展示了除其他外,Semiformer 是一个兼容大多数现代 transformer 和卷积神经架构的通用框架。代码可在 https://github.com/wengzejia1/Semiformer 获取。

关键词

引用

@article{arxiv.2111.11067,
  title  = {Semi-Supervised Vision Transformers},
  author = {Zejia Weng and Xitong Yang and Ang Li and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2111.11067},
  year   = {2022}
}

备注

16 pages, 4 figures, ECCV 2022