中文

面向语言模型中师生知识迁移高效性的神经架构搜索

计算与语言 2023-10-17 v2

摘要

大型预训练语言模型已在多种下游任务上取得最先进结果。将知识蒸馏(KD)到更小的学生模型中可解决其低效问题,便于在资源受限环境中部署。然而,当学生模型从一组现有选项中手动选取时,KD可能无效,因为该选择在全部可能学生架构空间中可能是次优的。我们开发了多语言KD-NAS,即利用神经架构搜索(NAS)在KD引导下,寻找用于从多语言教师进行任务无关蒸馏的最优学生架构。在搜索过程的每一轮中,NAS控制器基于蒸馏损失与推理延迟预测奖励。随后,在小型代理集上将顶级候选架构从教师蒸馏得到。最终选择奖励最高的架构,并在完整训练语料上蒸馏。KD-NAS能自动权衡效率与效果,并推荐适用于不同延迟预算的架构。使用我们的多层隐状态蒸馏过程,我们的KD-NAS学生模型相比XLM-Roberta Base教师,在CPU推理上实现7倍加速(GPU上2倍),同时保持90%性能,并已部署于3个需要大吞吐量、低延迟及CPU部署的软件产品中。

关键词

引用

@article{arxiv.2303.09639,
  title  = {Neural Architecture Search for Effective Teacher-Student Knowledge Transfer in Language Models},
  author = {Aashka Trivedi and Takuma Udagawa and Michele Merler and Rameswar Panda and Yousef El-Kurdi and Bishwaranjan Bhattacharjee},
  journal= {arXiv preprint arXiv:2303.09639},
  year   = {2023}
}

备注

11 pages, 5 figures