在多语言序列到序列预训练用于文本生成与理解时弥合跨语言鸿沟
计算与语言
2022-09-22 v2
摘要
对于多语言序列到序列预训练语言模型(multilingual Seq2Seq PLMs),例如 mBART,其自监督预训练任务在广泛单语语言上训练,例如来自 CommonCrawl 的 25 种语言,而下游跨语言任务通常在双语子集上推进,例如英-德,导致预训练与微调阶段间存在数据差异(即领域差异)与跨语言学习目标差异(即任务差异)。为弥合上述跨语言领域与任务鸿沟,我们用额外的码切换还原任务扩展了原始的预训练-微调流程。具体而言,第一阶段采用自监督码切换还原任务作为前置任务,使多语言 Seq2Seq PLMs 获取一定的域内对齐信息。第二阶段则正常在下游数据上微调模型。在 NLG 评测(12 项双语翻译任务、30 项零样本翻译任务与 2 项跨语言摘要任务)与 NLU 评测(7 项跨语言自然语言推理任务)上的实验表明,我们的模型一致地优于采用标准微调策略的强基线 mBART。分析显示,我们的方法可缩小跨语言句子表示的欧氏距离,并以极低计算成本提升模型泛化能力。代码发布于:https://github.com/zanchangtong/CSR4mBART。
引用
@article{arxiv.2204.07834,
title = {Bridging Cross-Lingual Gaps During Leveraging the Multilingual Sequence-to-Sequence Pretraining for Text Generation and Understanding},
author = {Changtong Zan and Liang Ding and Li Shen and Yu Cao and Weifeng Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.07834},
year = {2022}
}