中文

将英语中心的大型语言模型转变为多语言者:需要多少多语言性?

计算与语言 2024-10-04 v2

摘要

当今绝大多数大型语言模型 (LLMs) 都是以英语为中心的,主要在英语文本上进行预训练。然而,为了满足用户期望,模型一旦部署到下游应用中,就需要能够用多种语言做出适当响应。这需要强大的跨语言迁移能力。在这项工作中,我们研究了在微调过程中引发英语中心 LLM 跨语言泛化所需的最小多语言量。在对四个 LLM 的实验中,我们发现仅用两到三种语言进行多语言指令微调,对于引发有效的跨语言泛化既是必要的也是充分的,其限制因素在于目标语言在预训练期间被见的程度。对五个不同任务的评估进一步表明,多语言指令微调对于假设输入/输出语言一致的生成式任务(如聊天设置)最为有益,而对于高度结构化的分类式任务则重要性较低。我们的代码和数据可在 https://github.com/ZurichNLP/multilingual-instruction-tuning 获取。

关键词

引用

@article{arxiv.2312.12683,
  title  = {Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?},
  author = {Tannon Kew and Florian Schottmann and Rico Sennrich},
  journal= {arXiv preprint arXiv:2312.12683},
  year   = {2024}
}

备注

Accepted at Findings of EMNLP 2024