面向神经机器翻译的最近邻知识蒸馏
计算与语言
2022-05-03 v1
摘要
Khandelwal 等人(2021)提出的 k-最近邻机器翻译(NN-MT)在机器翻译任务中取得了许多最先进的结果。尽管有效,NN-MT 需要在推理阶段为每个解码步通过大型数据存储进行最近邻搜索,极大地增加了解码成本,从而导致难以部署于实际应用中。本文将耗时的 NN 搜索前移至预处理阶段,进而提出最近邻知识蒸馏(NN-KD),训练基础 NMT 模型直接学习 NN 的知识。蒸馏由 NN 检索到的知识可鼓励 NMT 模型考虑更合理的目标词符,从而解决过度纠正问题。大量实验结果表明,所提方法相较于包括 NN-MT 在内的最先进基线取得了一致性提升,同时保持与标准 NMT 模型相同的训练与解码速度。
引用
@article{arxiv.2205.00479,
title = {Nearest Neighbor Knowledge Distillation for Neural Machine Translation},
author = {Zhixian Yang and Renliang Sun and Xiaojun Wan},
journal= {arXiv preprint arXiv:2205.00479},
year = {2022}
}
备注
Accepted to NAACL 2022 Main Conference