Big Transfer (BiT):通用视觉表征学习
计算机视觉与模式识别
2020-05-07 v3 机器学习
摘要
迁移预训练表征可在训练视觉深度神经网络时提高样本效率并简化超参数调优。我们重新审视在大型监督数据集上预训练并在目标任务上微调模型的范式。我们扩大了预训练规模,并提出了一个称为 Big Transfer (BiT) 的简单方案。通过结合少量精心选择的组件,并使用简单启发式方法进行迁移,我们在超过 20 个数据集上取得了强劲性能。BiT 在出乎意料广泛的数据规模范围内表现良好——从每类 1 个样本到总计 1M 个样本。BiT 在 ILSVRC-2012 上达到 87.5% 的 top-1 准确率,在 CIFAR-10 上达到 99.4%,在 19 任务 Visual Task Adaptation Benchmark (VTAB) 上达到 76.3%。在小型数据集上,BiT 在每类 10 个样本的情况下于 ILSVRC-2012 取得 76.8%,在每类 10 个样本的情况下于 CIFAR-10 取得 97.0%。我们对导致高迁移性能的主要组件进行了详细分析。
引用
@article{arxiv.1912.11370,
title = {Big Transfer (BiT): General Visual Representation Learning},
author = {Alexander Kolesnikov and Lucas Beyer and Xiaohua Zhai and Joan Puigcerver and Jessica Yung and Sylvain Gelly and Neil Houlsby},
journal= {arXiv preprint arXiv:1912.11370},
year = {2020}
}
备注
The first three authors contributed equally. Results on ObjectNet are reported in v3