中文

SiT:自监督视觉 Transformer

计算机视觉与模式识别 2022-12-29 v3 机器学习

摘要

自监督学习方法因近期在缩小与监督学习差距方面的成功而在计算机视觉中受到越来越多的关注。在自然语言处理(NLP)中,自监督学习和 Transformer 已是首选方法。近期文献表明,Transformer 在计算机视觉中也日益流行。迄今为止,视觉 Transformer 已被证明在采用大规模监督数据或某种协同监督(例如教师网络)进行预训练时表现良好。这些监督预训练的视觉 Transformer 在下游任务中仅需极小改动即可取得非常好的结果。在本工作中,我们研究自监督学习用于预训练图像/视觉 Transformer 并将其用于下游分类任务的优点。我们提出自监督视觉 Transformer(SiT),并讨论若干用于获得预训练模型的自监督训练机制。SiT 的架构灵活性使其可用作自编码器并无缝处理多个自监督任务。我们表明,预训练的 SiT 可在仅含几千而非数百万图像的小规模数据集上微调用于下游分类任务。所提方法在标准数据集上依通用协议进行了评估。结果展示了 Transformer 的优势及其对自监督学习的适用性。我们以大幅优势超越了现有自监督学习方法。我们还观察到 SiT 擅长少样本学习,并通过在 SiT 学习到的特征之上简单训练线性分类器表明其学习了有用的表征。预训练、微调和评估代码将于 https://github.com/Sara-Ahmed/SiT 提供。

关键词

引用

@article{arxiv.2104.03602,
  title  = {SiT: Self-supervised vIsion Transformer},
  author = {Sara Atito and Muhammad Awais and Josef Kittler},
  journal= {arXiv preprint arXiv:2104.03602},
  year   = {2022}
}