中文

通过权重解缝将模型合并从微调扩展到预训练大语言模型

计算与语言 2024-08-07 v1

摘要

大语言模型 (LLM) 合并旨在将多个同源 LLM 合并为一个具备所有能力的模型。理想情况下,任何共享相同主干的 LLM 都应是可合并的,无论其是通过微调 (FT) 进行 minor 参数变更还是通过预训练 (PT) 进行 substantial 参数变更。然而,现有方法通常手动分配模型重要性,仅适用于参数变化相似的 LLM 进行操作,例如多个 FT LLM。FT 与 PT LLM 之间参数变更范围的差异为当前解决方案在经验上确定最佳组合提出了挑战。本文首次尝试将合并技术从 FT 扩展到 PT LLM。我们初始检查了当前方法在合并 FT 与 PT LLM 方面的有效性,发现它们难以处理 PT LLM。随后,我们引入一种基于 WeIght DisENtanglement (WIDEN) 的方法,以有效扩展合并范围,该方法首先将模型权重分解为幅度和方向组件,然后考虑其各自贡献进行自适应融合。在实验中,我们将 Qwen1.5-Chat (一个具备指令跟随技能的 FT LLM) 与 Sailor (一个具备多语言能力的 PT LLM) 在 7B 和 14B 模型规模上进行合并。结果表明:(1) 现有解决方案在合并 Sailor 时通常会失败,要么丢失两种能力,要么仅保留指令跟随技能;(2) WIDEN 成功地将 Sailor 的多语言能力注入 Qwen1.5-Chat,使其在东南亚语言方面表现出色,显著提升了基本能力。在此之前的研究中,我们也合并了多个 13B FT LLM,观察到 WIDEN 实现了指令跟随、数学推理和代码生成技能的平衡融合。

关键词

引用

@article{arxiv.2408.03092,
  title  = {Extend Model Merging from Fine-Tuned to Pre-Trained Large Language Models via Weight Disentanglement},
  author = {Le Yu and Bowen Yu and Haiyang Yu and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2408.03092},
  year   = {2024}
}

备注

17 pages