中文

面向轻量级神经机器翻译的演化知识蒸馏

计算与语言 2026-05-12 v1

摘要

神经机器翻译 (NMT) 的最新进展显著提高了翻译质量。然而,最先进模型的尺寸和复杂性不断增加,给在资源受限设备上部署带来了重大挑战。知识蒸馏 (KD) 是一种很有前景的模型压缩方法,但当教师模型和学生模型之间存在较大的容量差距时,其有效性会降低。为了解决这个问题,我们提出了演化知识蒸馏 (EKD),一种渐进式训练框架,其中学生模型从一系列容量逐渐增加的教师模型中学习。在 IWSLT-14、WMT-17 和 WMT-23 基准上的实验表明,EKD 在每个阶段都带来了一致的改进。在 IWSLT-14 上,最终学生模型达到了 34.24 的 BLEU 分数,将与大容量教师模型 (34.32 BLEU) 的差距缩小至仅 0.08 BLEU。在其他数据集上也观察到类似的趋势。这些结果表明 EKD 有效弥合了容量差距,使紧凑模型能够实现接近大得多的教师模型的性能。代码和模型可在 https://github.com/agi-content-generation/EKD 获取。

关键词

引用

@article{arxiv.2605.09924,
  title  = {Evolving Knowledge Distillation for Lightweight Neural Machine Translation},
  author = {Xuewen Zhang and Haixiao Zhang and Xinlong Huang},
  journal= {arXiv preprint arXiv:2605.09924},
  year   = {2026}
}