中文

推进多语言预训练:面向多语言语言模型的三元组文档级预训练TRIP

计算与语言 2023-05-16 v2

摘要

尽管多语言序列到序列预训练取得了成功,现有多数方法依赖于多种不同语言的文档级单语语料、句子级双语语料\footnote{本文中,我们用“双语语料”指代具有多种不同语言对的“双语翻译对”的平行语料,每对由意义相同但用不同语言写成的两个句子/文档组成。我们用“三语语料”指代具有多种不同语言组合的“三语翻译对”的平行语料,每组合由三个句子/文档组成。},以及有时合成的文档级双语语料。这制约了在文档级跨语言任务(如文档级翻译)上的表现。因此,我们提出挖掘并利用文档级三语平行语料来改进序列到序列多语言预训练。我们提出\textbf{Tri}angular文档级\textbf{P}re-training(\textbf{TRIP}),这是该领域首个通过称为Grafting的新方法将常规单语与双语目标加速为三语目标的方法。实验表明,TRIP在三个多语言文档级机器翻译基准和一个跨语言抽取式摘要基准上取得了若干强劲的当前最优(SOTA)分数,包括最高达3.11 d-BLEU点和8.9 ROUGE-L点的持续提升。

关键词

引用

@article{arxiv.2212.07752,
  title  = {Advancing Multilingual Pre-training: TRIP Triangular Document-level Pre-training for Multilingual Language Models},
  author = {Hongyuan Lu and Haoyang Huang and Shuming Ma and Dongdong Zhang and Wai Lam and Furu Wei},
  journal= {arXiv preprint arXiv:2212.07752},
  year   = {2023}
}