基于n-best重排序的精确知识蒸馏
计算与语言
2024-06-14 v4
摘要
我们提出利用n-best重排序来增强序列级知识蒸馏(Kim and Rush, 2016),即从top n-best假设中提取伪标签作为学生模型的训练数据,并利用一组具有不同归纳偏置、目标函数或架构的多样化模型(包括一些公开可用的大语言模型)来挑选质量最高的假设作为标签。我们通过WMT'21德英和英中翻译任务的实验验证了我们方法的有效性。我们的结果表明,使用由我们的n-best重排序器生成的伪标签训练可得到显著更精确的学生模型。事实上,我们最好的学生模型达到了与(Tran et al., 2021)中拥有47亿参数的大型翻译模型相当的精度,而参数数量少了两个数量级。
引用
@article{arxiv.2305.12057,
title = {Accurate Knowledge Distillation with n-best Reranking},
author = {Hendra Setiawan},
journal= {arXiv preprint arXiv:2305.12057},
year = {2024}
}