面向神经机器翻译的合成预训练任务
计算与语言
2023-06-01 v2 人工智能
摘要
使用大规模爬取语料预训练模型可能导致毒性、偏见以及版权和隐私等问题。缓解此类担忧的一种有前景的方法是利用合成任务与数据进行预训练,因为模型不摄入任何真实世界信息。本文的目标是理解在使用合成资源时影响预训练模型有效性的因素,特别是在神经机器翻译背景下。我们提出了几种新颖的神经机器翻译模型预训练方法,涉及不同层次的词汇与结构知识,包括:1)从大型平行语料生成混淆数据;2)拼接从小规模词对齐语料提取的短语对;3)在无真实人类语言语料的情况下生成合成平行数据。我们在多语言对上的实验表明,即便在高度混淆或纯合成平行数据下,预训练收益仍可实现。我们希望全面实证分析所得发现能有助于理解神经机器翻译预训练的关键所在,并为开发更高效、更低毒性的模型铺平道路。
引用
@article{arxiv.2212.09864,
title = {Synthetic Pre-Training Tasks for Neural Machine Translation},
author = {Zexue He and Graeme Blackwood and Rameswar Panda and Julian McAuley and Rogerio Feris},
journal= {arXiv preprint arXiv:2212.09864},
year = {2023}
}
备注
Accepted to ACL2023-Findings. New added Phrase-cat for synthetic pre-training. 17 pages including 5-page appendix