论蒸馏作为预训练小模型替代方案的惊人有效性
机器学习
2024-05-06 v2 人工智能
摘要
在本文中,我们提出小模型可能不需要承担预训练的成本即可获得其收益。相反,它们可以在惊人的程度上利用现代巨大模型所取得的惊人成果。我们观察到,当从预训练教师模型中对特定任务进行蒸馏时,小模型可以达到或超过其经过预训练后在该任务上微调所能达到的性能。为了使这一现象能够被轻松利用,我们建立了一种将知识蒸馏简化为现代对比学习的联系,打开了了两扇大门:(1) 差异极大的模型架构配对可以用于蒸馏,以及 (2) 大多数根植于噪声对比估计理论的对比学习算法可以轻松地被应用和使用。我们使用来自开源模型中心的预训练教师模型、Transformer 与基于卷积的模型组合,以及一种将 Wang & Isola (2020) 的对比学习的 Alignment/Uniformity 视角转化为蒸馏目标的新型蒸馏算法,演示了这一范式。我们选择这种风味的对比学习是因为其计算成本低,这是本工作的一个核心主题。我们还观察到,如果任务受数据限制,这种现象往往不会发生。然而,这可以通过利用另一种受规模启发的发展来缓解:用于数据集增强的大型预训练生成模型。同样,我们使用了一个开源模型,而我们基础的提示足以提升小模型的性能。因此,我们突出了一种小模型的训练方法,该方法比标准预训练范式快达 94%,且不牺牲性能。对于那些由于规模庞大而无法完全利用现代基础数据集来训练小模型的从业者,我们相信我们的工作为他们保留了这一可能。
引用
@article{arxiv.2404.03263,
title = {On the Surprising Efficacy of Distillation as an Alternative to Pre-Training Small Models},
author = {Sean Farhat and Deming Chen},
journal= {arXiv preprint arXiv:2404.03263},
year = {2024}
}
备注
ICLR 2024. 5th Workshop on Practical ML for Low Resource Settings (PML4LRS). Code can be found at https://github.com/sfarhat/dapt