中文

模型合并在 LLM 跨语言迁移中的非理性有效性

计算与语言 2025-10-09 v2 人工智能 机器学习

摘要

大语言模型(LLMs)在高资源语言以外的任务上仍然表现不佳。本工作研究了在任务特定后训练数据稀缺的情况下,向低资源语言进行跨语言迁移。基于先前工作,我们首先验证了对数学推理和多语言能力最重要的模型参数子集是明显不重叠的。为了利用任务和目标语言参数化之间的这种隐式可分离性,我们开发并分析了多种模块化框架,以改善在微调过程中两者的组合。这些方法通常采用冻结参数或事后模型合并,将数学能力和语言提升分配到 LLM 的不同关键部分。在缺乏目标语言数学数据的情况下,我们证明模块化方法在三种语言、四种模型和两种微调范式(全微调和 LoRA)上均成功超越了基线。此外,我们发现最一致的模块化方法是分别微调语言和数学专家并通过层交换进行模型合并,这一点有些出人意料。我们通过近期关于任务向量线性的工作为这一结果提供了可能的解释。进一步地,我们通过实证表明,在训练后撤销效用较低微调更新的效果往往优于从一开始就冻结它们。

关键词

引用

@article{arxiv.2505.18356,
  title  = {The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs},
  author = {Lucas Bandarkar and Nanyun Peng},
  journal= {arXiv preprint arXiv:2505.18356},
  year   = {2025}
}

备注

MRL Workshop at EMNLP 2025