中文

模型合并在低资源语言中的潜力挖掘

计算与语言 2025-02-10 v3 人工智能

摘要

将大型语言模型 (LLM) 适应到新语言,通常涉及持续预训练 (CT) 后跟随监督式微调 (SFT)。然而,该 CT-然后-SFT 方法在低资源语言的语境中难以应对数据有限的情况,无法在语言建模和任务解决能力之间取得平衡。我们因此提出了模型合并作为低资源语言的替代方案,将具有不同能力的模型组合到单个模型中,而无需额外训练。我们使用模型合并为低资源语言开发任务解决型 LLM,而无需目标语言中的 SFT 数据。基于 Llama-2-7B 的实验表明,模型合并有效地为低资源语言的 LLM 注入了任务解决能力,在数据极其稀缺的情境下超越了 CT-然后-SFT。观察到模型合并在更多训练标记数下呈现性能饱和,我们进一步分析了合并过程,引入松弛变量到模型合并算法中,以缓解重要参数的损失,从而提升性能。我们希望模型合并能惠及更多因数据稀缺而受影响的人类语言。

关键词

引用

@article{arxiv.2407.03994,
  title  = {Unlocking the Potential of Model Merging for Low-Resource Languages},
  author = {Mingxu Tao and Chen Zhang and Quzhe Huang and Tianyao Ma and Songfang Huang and Dongyan Zhao and Yansong Feng},
  journal= {arXiv preprint arXiv:2407.03994},
  year   = {2025}
}

备注

To appear in EMNLP2024 Findings