教师引导训练:一种高效的知识迁移框架
机器学习
2022-08-16 v1
摘要
诸如 GPT-3 等大型预训练模型所实现的显著性能提升,依赖于其在训练期间所接触的海量数据。类似地,将此类大型模型蒸馏为紧凑模型以实现高效部署,同样需要大量(有标注或无标注)训练数据。在本文中,我们提出教师引导训练(TGT)框架,用于训练高质量的紧凑模型,该框架利用预训练生成模型所习得的知识,同时避免需要处理大量数据。TGT 利用了这样一个事实:教师模型已获得对底层数据域的良好表征,该数据域通常对应于比输入空间维数低得多的流形。此外,我们可以通过采样或基于梯度的方法利用教师模型更高效地探索输入空间;因此,TGT 在有限数据或长尾场景下尤其具有吸引力。我们在泛化界中形式化地刻画了这种所提出的数据域探索带来的益处。我们发现,TGT 能够在多个图像分类基准以及一系列文本分类与检索任务上提升准确率。
引用
@article{arxiv.2208.06825,
title = {Teacher Guided Training: An Efficient Framework for Knowledge Transfer},
author = {Manzil Zaheer and Ankit Singh Rawat and Seungyeon Kim and Chong You and Himanshu Jain and Andreas Veit and Rob Fergus and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2208.06825},
year = {2022}
}