中文

mmT5:模块化多语言预训练解决源语言幻觉问题

计算与语言 2023-05-24 v1

摘要

多语言序列到序列模型在语言覆盖增加时效能下降,且难以在少样本设定下持续生成正确目标语言的文本。为应对这些挑战,我们提出 mmT5,一种模块化多语言序列到序列模型。mmT5 在预训练期间利用语言特定模块,将语言特定信息与时语言无关信息解耦。我们识别出微调过程中的表示漂移是模块化生成模型的关键局限,并开发了可实现有效零样本迁移的策略。我们的模型在相同参数量下于 40 余种语言的代表性自然语言理解与生成任务上大幅超越 mT5。相比 mT5,mmT5 在零样本设定下生成正确语言文本的比例从 7% 提升至 99%,从而极大缓解了源语言幻觉问题。

关键词

引用

@article{arxiv.2305.14224,
  title  = {mmT5: Modular Multilingual Pre-Training Solves Source Language Hallucinations},
  author = {Jonas Pfeiffer and Francesco Piccinno and Massimo Nicosia and Xinyi Wang and Machel Reid and Sebastian Ruder},
  journal= {arXiv preprint arXiv:2305.14224},
  year   = {2023}
}