中文

面向神经机器翻译的最近邻知识蒸馏

计算与语言 2022-05-03 v1

摘要

Khandelwal 等人(2021)提出的 k-最近邻机器翻译(NN-MT)在机器翻译任务中取得了许多最先进的结果。尽管有效,NN-MT 需要在推理阶段为每个解码步通过大型数据存储进行最近邻搜索,极大地增加了解码成本,从而导致难以部署于实际应用中。本文将耗时的 NN 搜索前移至预处理阶段,进而提出最近邻知识蒸馏(NN-KD),训练基础 NMT 模型直接学习 NN 的知识。蒸馏由 NN 检索到的知识可鼓励 NMT 模型考虑更合理的目标词符,从而解决过度纠正问题。大量实验结果表明,所提方法相较于包括 NN-MT 在内的最先进基线取得了一致性提升,同时保持与标准 NMT 模型相同的训练与解码速度。

关键词

引用

@article{arxiv.2205.00479,
  title  = {Nearest Neighbor Knowledge Distillation for Neural Machine Translation},
  author = {Zhixian Yang and Renliang Sun and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2205.00479},
  year   = {2022}
}

备注

Accepted to NAACL 2022 Main Conference