中文

Unbabel 提交至 WMT2019 APE 共享任务的系统:基于 BERT 的编码器-解码器用于自动后编辑

计算与语言 2019-07-02 v2

摘要

本文描述了 Unbabel 提交至 WMT2019 APE 共享任务的英德语言对系统。随着近期大型、强大的预训练模型的兴起,我们适配 BERT 预训练模型,在编码器-解码器框架中执行自动后编辑(Automatic Post-Editing, APE)。类似于双编码器架构,我们开发了基于 BERT 的编码器-解码器(BERT-based encoder-decoder, BED)模型,其中单一的预训练 BERT 编码器同时接收源语言字符串 src 和机器翻译字符串 tgt。此外,我们探索了一种保守性因子,以约束 APE 系统执行更少的编辑。如官方结果显示,当在领域内与人工训练数据的加权组合上训练时,我们带有保守性惩罚的 BED 系统在 TER 和 BLEU 上分别以 0.78-0.78+1.23+1.23 显著改进了一个强神经机器翻译(Neural Machine Translation, NMT)系统的译文。最后,我们的提交在英德 NMT 的 APE 中并列达到了新的最先进水平(state-of-the-art, SOTA)。

关键词

引用

@article{arxiv.1905.13068,
  title  = {Unbabel's Submission to the WMT2019 APE Shared Task: BERT-based Encoder-Decoder for Automatic Post-Editing},
  author = {António V. Lopes and M. Amin Farajian and Gonçalo M. Correia and Jonay Trenous and André F. T. Martins},
  journal= {arXiv preprint arXiv:1905.13068},
  year   = {2019}
}

备注

Updated sections 2.2 and 4