将 BERT 引入神经机器翻译
计算与语言
2020-02-18 v1
摘要
近期提出的 BERT 在各种自然语言理解任务(如文本分类、阅读理解等)上展现了强大能力。然而,如何有效地将 BERT 应用于神经机器翻译(NMT)尚缺乏充分探索。虽然 BERT 在下游语言理解任务中更常用作微调而非上下文嵌入,但在 NMT 中,我们将 BERT 用作上下文嵌入的初步探索优于用作微调。这促使我们思考如何沿此方向更好地利用 BERT 服务于 NMT。我们提出一种称为 BERT-fused 模型的新算法,其中首先使用 BERT 提取输入序列的表示,然后通过注意力机制将这些表示与 NMT 模型的编码器和解码器的每一层相融合。我们在有监督(包括句子级和文档级翻译)、半监督和无监督机器翻译上开展实验,并在七个基准数据集上取得了 SOTA 结果。我们的代码见 \url{https://github.com/bert-nmt/bert-nmt}。
引用
@article{arxiv.2002.06823,
title = {Incorporating BERT into Neural Machine Translation},
author = {Jinhua Zhu and Yingce Xia and Lijun Wu and Di He and Tao Qin and Wengang Zhou and Houqiang Li and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2002.06823},
year = {2020}
}
备注
Accepted to ICLR-2020