面向神经机器翻译的集成蒸馏
计算与语言
2017-08-09 v2
摘要
知识蒸馏描述了一种通过从更强的教师网络学习来训练学生网络以表现更好的方法。使用神经机器翻译(NMT)引擎翻译句子耗时,而更小的模型可加速该过程。我们展示了如何将集成模型和预言BLEU教师网络的翻译质量迁移到单一NMT系统中。此外,我们呈现了来自与 student 网络具有相同架构和维度的教师网络的翻译改进。由于学生模型训练仍昂贵,我们引入一种基于教师模型知识的数据过滤方法,不仅加速训练,且带来更好翻译质量。我们的技术无需代码更改,可轻易用任何NMT架构复现以加速解码过程。
引用
@article{arxiv.1702.01802,
title = {Ensemble Distillation for Neural Machine Translation},
author = {Markus Freitag and Yaser Al-Onaizan and Baskaran Sankaran},
journal= {arXiv preprint arXiv:1702.01802},
year = {2017}
}