面向高效连续训练运行的知识蒸馏
机器学习
2023-03-14 v1 计算机视觉与模式识别
摘要
在许多实际场景中——如超参数搜索或使用新数据持续重训练——相关的训练运行会按顺序多次执行。当前的做法是从头开始独立训练每个模型。我们研究利用先前运行中所投入的计算、通过知识蒸馏(KD)来降低未来运行成本的问题。我们发现,用来自先前运行的 KD 增强未来运行可大幅减少训练这些模型所需的时间,即便计入 KD 的开销也是如此。我们通过两种策略改进这些结果,将 KD 的开销减少 80-90%,对精度影响极小,并在总体成本上实现巨大的帕累托改进。我们得出结论:KD 是降低实践中训练最终模型之前昂贵准备工作成本的一个有前景的途径。
引用
@article{arxiv.2303.06480,
title = {Knowledge Distillation for Efficient Sequences of Training Runs},
author = {Xingyu Liu and Alex Leonardi and Lu Yu and Chris Gilmer-Hill and Matthew Leavitt and Jonathan Frankle},
journal= {arXiv preprint arXiv:2303.06480},
year = {2023}
}
备注
This paper was accepted by ICML 2022 First Workshop of Pre-training: Perspectives, Pitfalls, and Paths Forward