在神经机器翻译中充分利用 BERT
计算与语言
2022-06-22 v5 机器学习
摘要
GPT-2 与 BERT 证明了在各种自然语言处理任务上使用预训练语言模型(LMs)的有效性。然而,当应用于资源丰富的任务时,LM 微调常遭受灾难性遗忘。本工作中,我们引入一种协同训练框架(CTNMT),其为将预训练 LMs 整合到神经机器翻译(NMT)的关键。我们提出的 CTNMT 包含三项技术:a) 渐近蒸馏以确保 NMT 模型能保留先前的预训练知识;b) 动态切换门以避免预训练知识的灾难性遗忘;c) 依据调度策略调整学习节奏的策略。我们在机器翻译上的实验显示,CTNMT 在 WMT14 英德语言对上获得最高 3 个 BLEU 分的提升,甚至超越先前最先进的预训练辅助 NMT 达 1.4 个 BLEU 分。而对于含有 4000 万句对的 WMT14 英法大型任务,我们的基础模型仍显著优于最先进的 Transformer big 模型超过 1 个 BLEU 分。代码与模型可从 https://github.com/bytedance/neurst/ tree/master/examples/ctnmt 下载。
引用
@article{arxiv.1908.05672,
title = {Towards Making the Most of BERT in Neural Machine Translation},
author = {Jiacheng Yang and Mingxuan Wang and Hao Zhou and Chengqi Zhao and Yong Yu and Weinan Zhang and Lei Li},
journal= {arXiv preprint arXiv:1908.05672},
year = {2022}
}
备注
10pages. the same as AAAI 2020 version, reformated with additional link to github repository