mmT5:模块化多语言预训练解决源语言幻觉问题
计算与语言
2023-05-24 v1
摘要
多语言序列到序列模型在语言覆盖增加时效能下降,且难以在少样本设定下持续生成正确目标语言的文本。为应对这些挑战,我们提出 mmT5,一种模块化多语言序列到序列模型。mmT5 在预训练期间利用语言特定模块,将语言特定信息与时语言无关信息解耦。我们识别出微调过程中的表示漂移是模块化生成模型的关键局限,并开发了可实现有效零样本迁移的策略。我们的模型在相同参数量下于 40 余种语言的代表性自然语言理解与生成任务上大幅超越 mT5。相比 mT5,mmT5 在零样本设定下生成正确语言文本的比例从 7% 提升至 99%,从而极大缓解了源语言幻觉问题。
引用
@article{arxiv.2305.14224,
title = {mmT5: Modular Multilingual Pre-Training Solves Source Language Hallucinations},
author = {Jonas Pfeiffer and Francesco Piccinno and Massimo Nicosia and Xinyi Wang and Machel Reid and Sebastian Ruder},
journal= {arXiv preprint arXiv:2305.14224},
year = {2023}
}