中文

预训练多语言语言模型在生成任务中零样本跨语言知识迁移的实证研究

计算与语言 2024-04-23 v3

摘要

零样本跨语言知识迁移使得在多语言预训练语言模型(mPLM)上以某一种语言对任务进行微调后,可对该任务在其他语言上作出预测。尽管该设定在自然语言理解任务中已被广泛研究,但在生成任务中尚缺乏充分研究。先前工作注意到常以错误语言生成的频繁问题,并提出了通常基于 mT5 骨干模型的应对方法。在本工作中,我们测试了替代的 mPLM,如 mBART 与 NLLB-200,考虑了全微调与基于适配器的参数高效微调。我们发现带适配器的 mBART 与同尺寸 mT5 表现相近,且 NLLB-200 在某些情况下具有竞争力。我们还强调了微调所用学习率调优的重要性,其有助于缓解以错误语言生成的问题。

关键词

引用

@article{arxiv.2310.09917,
  title  = {Empirical study of pretrained multilingual language models for zero-shot cross-lingual knowledge transfer in generation},
  author = {Nadezhda Chirkova and Sheng Liang and Vassilina Nikoulina},
  journal= {arXiv preprint arXiv:2310.09917},
  year   = {2024}
}

备注

This preprint describes a preliminary study for our follow-up work arXiv:2402.12279 (NAACL 2024), in which we investigate important factors for enabling zero-shot cross-lingual transfer in generative tasks