中文

DOCmT5:多语言语言模型的文档级预训练

计算与语言 2022-05-06 v2

摘要

本文中,我们介绍 DOCmT5,一个使用大规模平行文档预训练的多语言序列到序列语言模型。先前的方法侧重于利用句子级平行数据,而我们试图构建一个能够理解和生成长文档的通用预训练模型。我们提出了一个简单而有效的预训练目标——文档重排序机器翻译(DrMT),其中被打乱并掩码的输入文档需要被翻译。DrMT 在多种文档级生成任务上相较强基线带来一致提升,包括已见语言对的文档级机器翻译提升超过 12 个 BLEU 点、未见语言对的文档级机器翻译提升超过 7 个 BLEU 点,以及已见语言对的跨语言摘要提升超过 3 个 ROUGE-1 点。我们在 WMT20 De-En 和 IWSLT15 Zh-En 文档翻译任务上取得了最先进(SOTA)结果。我们还对文档预训练的多种因素进行了广泛分析,包括(1)预训练数据质量的影响以及(2)单语与跨语言预训练结合的影响。我们计划公开我们的模型检查点。

关键词

引用

@article{arxiv.2112.08709,
  title  = {DOCmT5: Document-Level Pretraining of Multilingual Language Models},
  author = {Chia-Hsuan Lee and Aditya Siddhant and Viresh Ratnakar and Melvin Johnson},
  journal= {arXiv preprint arXiv:2112.08709},
  year   = {2022}
}

备注

NAACL 2022 Findings