多容量模型的一站式训练
计算与语言
2023-05-25 v2
摘要
训练具有不同容量的模型有利于在不同场景中部署。高容量模型提供更好性能,而低容量模型在训练与推理时需要更少的计算资源。在本工作中,我们提出一种新颖的一站式训练框架,联合训练高容量与低容量模型。该框架由两种复合模型架构与一种称为两阶段联合训练(TSJT)的联合训练算法组成。与分别从零单独训练多容量模型的知识蒸馏不同,我们的方法同时整合来自不同容量模型的监督信号,从而实现更快且更高效的收敛。在多语言机器翻译基准 WMT10 上的大量实验表明,我们的方法优于低容量基线模型,并在高容量模型上取得可比或更优的性能。值得注意的是,分析表明我们的方法显著影响初始训练过程,带来更高效的收敛与更优的解。
引用
@article{arxiv.2305.14066,
title = {One-stop Training of Multiple Capacity Models},
author = {Lan Jiang and Haoyang Huang and Dongdong Zhang and Rui Jiang and Furu Wei},
journal= {arXiv preprint arXiv:2305.14066},
year = {2023}
}