微软翻译系统在WMT 2019:迈向大规模文档级神经机器翻译
计算与语言
2019-07-16 v1
摘要
本文描述了微软翻译系统向WMT19新闻翻译共享任务(英德方向)的提交。我们的主要焦点是采用深度Transformer模型的文档级神经机器翻译。我们从强大的句子级基线开始,这些基线在通过数据过滤和含噪回译创建的大规模数据上训练,并发现回译似乎主要有助于翻译体输入。我们探索微调技术、更深模型以及不同集成策略来对抗这些效应。利用真实与合成平行数据中存在的文档边界,我们创建了多达1000个子词片段的序列并训练Transformer翻译模型。我们对具有文档边界的较小真实数据以及无边界的较大真实数据实验了数据增强技术。我们进一步探索多任务训练,通过编码器上的BERT目标引入文档级源语言单语数据,以及用于句子级与文档级系统组合的两遍解码。基于初步人工评估结果,评估者强烈偏好文档级系统甚于我们可比较的句子级系统。文档级系统在基于源的直接评估中也似乎得分高于人工参考译文。
引用
@article{arxiv.1907.06170,
title = {Microsoft Translator at WMT 2019: Towards Large-Scale Document-Level Neural Machine Translation},
author = {Marcin Junczys-Dowmunt},
journal= {arXiv preprint arXiv:1907.06170},
year = {2019}
}
备注
WMT 2019 Shared Task submission