中文

蒸馏、适配、蒸馏:训练用于神经机器翻译的小型领域内模型

计算与语言 2020-06-24 v3

摘要

我们探索在领域适配设定下,利用序列级知识蒸馏训练小型、内存高效的机器翻译模型的最佳实践。尽管领域适配与知识蒸馏均被广泛使用,二者间的相互作用仍鲜为人知。我们在机器翻译(三个语言对、各含三个领域)上的大规模实证结果表明,为获得最佳性能需进行两次蒸馏:先使用通用领域数据,再使用经适配的教师模型的领域内数据。

关键词

引用

@article{arxiv.2003.02877,
  title  = {Distill, Adapt, Distill: Training Small, In-Domain Models for Neural Machine Translation},
  author = {Mitchell A. Gordon and Kevin Duh},
  journal= {arXiv preprint arXiv:2003.02877},
  year   = {2020}
}

备注

Accepted to WNGT 2020 Workshop at ACL 2020 Conference. Code is at http://github.com/mitchellgordon95/kd-aug