用于低数据迁移学习的深度集成方法
机器学习
2020-10-20 v2 计算机视觉与模式识别
机器学习
摘要
在低数据场景下,从头训练良好的监督模型十分困难。实践者转而采用预训练模型,利用迁移学习。集成是一种在经验与理论上都具吸引力的构建强大预测模型的方法,但主流的通过不同随机初始化训练多个深度网络的方法,与通过预训练权重进行迁移的需求相冲突。在本工作中,我们研究了从预训练模型构建集成的不同方式。我们表明,预训练过程本身即是多样性的一个高效来源,并提出了一种实用算法,可针对任意下游数据集高效识别出预训练模型的子集。该方法十分简单:使用最近邻准确率对预训练模型排序,以小规模超参数搜索微调最优模型,并贪心地构建集成以最小化验证交叉熵。在 19 个不同下游任务(Visual Task Adaptation Benchmark)上与强基线一同评估时,即便从超过 2,000 个预训练模型中选择,该方法也能以低得多的推理代价取得最先进的性能。我们还在 ImageNet 变体上评估了我们的集成,并展示了其对分布偏移的鲁棒性改善。
引用
@article{arxiv.2010.06866,
title = {Deep Ensembles for Low-Data Transfer Learning},
author = {Basil Mustafa and Carlos Riquelme and Joan Puigcerver and André Susano Pinto and Daniel Keysers and Neil Houlsby},
journal= {arXiv preprint arXiv:2010.06866},
year = {2020}
}