PEACH:基于半监督伪平行文档生成的序列到序列多语言翻译预训练模型
计算与语言
2023-06-02 v2
摘要
多语言预训练显著改善了包括机器翻译在内的许多多语言 NLP 任务。大多数现有方法基于单语数据上某种形式的掩码语言建模和文本去噪目标。单语数据上的多语言预训练忽视了多语言对中存在平行数据的事实。此外,一些其他工作在其预训练中整合了可用的人工生成平行翻译数据。这类平行数据无疑有帮助,但即使在资源丰富语言对中也有限。本文引入一种新颖的半监督方法 SPDG,为多语言预训练生成高质量伪平行数据。首先,在单语数据上预训练一个去噪模型以重排、添加、删除和替换词,提升预训练文档质量。然后,我们使用词典进行逐词翻译并应用预训练去噪模型,为每个预训练文档生成不同的伪翻译。所得伪平行数据随后用于预训练我们的多语言序列到序列模型 PEACH。我们的实验表明,PEACH 在各种翻译任务(包括监督、零样本和少样本场景)上优于训练 mT5 和 mBART 时使用的现有方法。此外,PEACH 在相似语言间迁移知识的能力使其对低资源语言尤为有用。我们的结果表明,利用高质量词典生成准确伪平行数据,PEACH 可对低资源语言大有价值。
引用
@article{arxiv.2304.01282,
title = {PEACH: Pre-Training Sequence-to-Sequence Multilingual Models for Translation with Semi-Supervised Pseudo-Parallel Document Generation},
author = {Alireza Salemi and Amirhossein Abaskohi and Sara Tavakoli and Yadollah Yaghoobzadeh and Azadeh Shakery},
journal= {arXiv preprint arXiv:2304.01282},
year = {2023}
}
备注
15 pages, 5 figures, 16 tables, 1 algorithm, LoResMT@EACL 2023