中文

一种用于训练有竞争力的低计算量自监督视觉模型的简单方法

计算机视觉与模式识别 2023-01-24 v1 人工智能 机器学习

摘要

视觉领域的自监督方法大多聚焦于大型架构,因为对于较小的架构,其性能似乎会出现显著下降。在本文中,我们提出了一种简单的自监督蒸馏技术,能够训练高性能的低计算量神经网络。我们的核心见解是,现有的基于联合嵌入的自监督学习(SSL)方法可被重新用于从大型自监督教师模型到小型学生模型的知识蒸馏。因此,我们将该方法称为替换一支(Replace one Branch, RoB),因为它只是将联合嵌入训练中的一支替换为大型教师模型。RoB 广泛适用于多种架构,如小型 ResNet、MobileNet 和 ViT,以及 DINO、SwAV 或 iBOT 等预训练模型。在 ImageNet 数据集上预训练时,RoB 得到的模型可与有监督知识蒸馏相媲美。应用于 MSN 时,RoB 生成的学生模型具有强大的半监督能力。最后,我们最佳的 ViT-Tiny 模型在 ImageNet 上比先前的 SSL 最优结果提升了 2.3%2.3\%,并且在五个下游迁移任务(iNaturalist、CIFAR、Clevr/Count、Clevr/Dist 和 Places)上与有监督蒸馏的 DeiT 相当或更优。我们希望 RoB 能够在较小规模下实现实用的自监督学习。

关键词

引用

@article{arxiv.2301.09451,
  title  = {A Simple Recipe for Competitive Low-compute Self supervised Vision Models},
  author = {Quentin Duval and Ishan Misra and Nicolas Ballas},
  journal= {arXiv preprint arXiv:2301.09451},
  year   = {2023}
}