中文

nmT5——并行数据对于预训练大规模多语言语言模型是否仍然重要?

计算与语言 2021-06-07 v1

摘要

近来,mT5——T5 的大规模多语言版本——利用统一的文本到文本格式,在多种多语言 NLP 任务上取得了最先进的结果。在本文中,我们研究了在 mT5 预训练中引入并行数据的影响。我们发现,在预训练期间通过机器翻译等目标进行多任务语言建模,是提升下游多语言与跨语言任务性能的一种直接方法。然而,随着模型容量增大,增益开始减弱,这表明对于更大的模型而言,并行数据可能并非不可或缺。与此同时,即使在更大的模型规模下,我们发现使用并行数据进行预训练在标注数据有限的场景下仍能带来收益。

关键词

引用

@article{arxiv.2106.02171,
  title  = {nmT5 -- Is parallel data still relevant for pre-training massively multilingual language models?},
  author = {Mihir Kale and Aditya Siddhant and Noah Constant and Melvin Johnson and Rami Al-Rfou and Linting Xue},
  journal= {arXiv preprint arXiv:2106.02171},
  year   = {2021}
}

备注

Accepted at ACL-IJCNLP 2021