中文

持续将新语言添加到多语言语言模型中

计算与语言 2025-09-16 v1

摘要

多语言语言模型是在固定语言集合上训练的,为了支持新语言,需要从头重新训练模型。这是一个代价高昂的举措,常常不可行,因为模型开发者倾向于不公开他们的预训练数据。朴素的方法,如继续预训练,会受到灾难性遗忘;然而,像经验回放这样的缓解策略由于缺乏原始预训练数据而无法应用。在本工作中,我们研究了在仅访问目标语言预训练数据的情况下,将新语言持续添加到多语言模型中的问题。我们探索了解决该问题的多种方法,并提出了基于层选择的 LoRA (LayRA),该方法在所选的初始和最终层上添加低秩适配器 (LoRA),而保持其余模型冻结。LayRA 基于两个见解:(1) LoRA 减少遗忘,(2) 多语言模型在初始层上对源语言输入进行编码,在中间层用英语进行推理,并在最终层将其翻译回源语言。我们对添加 Galicia、Swahili 和 Urdu 多种语言组合进行实验,并在多样化的多语言任务上对每种方法进行评估。我们发现 LayRA 在保持先前支持语言能力的同时,在学习新语言方面与现有方法如 LoRA 相当,在整体上提供了最佳的权衡。我们还演示了使用模型算术,适应后的模型可以在不访问目标语言任何指令调优数据的情况下获得强大的指令遵循能力。

关键词

引用

@article{arxiv.2509.11414,
  title  = {Continually Adding New Languages to Multilingual Language Models},
  author = {Abraham Toluwase Owodunni and Sachin Kumar},
  journal= {arXiv preprint arXiv:2509.11414},
  year   = {2025}
}