中文

无需训练的大语言模型专家动态升级

机器学习 2026-04-01 v1 计算与语言

摘要

大语言模型 (LLMs) 在广泛的专业任务上取得了显著性能,展现出强大的问题解决能力。然而,训练这些模型成本高昂,且它们通常缺乏领域特定专长,因为它们依赖通用知识数据集。专长微调可以解决此问题,但往往导致过度专业化,且由于目标分歧,开发单一多领域专家仍然困难。此外,多任务训练因干扰和灾难性遗忘而具有挑战性。现有工作提出在专家混合 (MoE) 架构中组合密集模型的专长,尽管该方法仍需多任务微调。为解决这些问题,我们提出了动态升级专家混合模型 (DUME),一种利用在不同领域训练的密集专家构建统一 MoE 模型的新方法。我们的方法构建了一个单一多任务模型,无需额外训练即可保留原始密集专家的能力。DUME 既经济又可扩展:通过利用岭回归的封闭形式解,它消除了进一步优化的需要,并支持动态添加专家同时保持模型的原始性能。我们证明 DUME 在因果语言建模和推理设置中始终优于基线方法。最后,我们还表明 DUME 模型可以进一步微调以提升性能。我们表明,在因果语言建模设置中,DUME 可保留针对某一特定领域训练的密集专家模型高达 97.6% 的能力,并且在推理设置中它可以超越该专家,达到密集专家性能的 102.1%。我们的代码可在以下地址获取:github.com/gensyn-ai/dume。

关键词

引用

@article{arxiv.2603.29765,
  title  = {Training-Free Dynamic Upcycling of Expert Language Models},
  author = {Eros Fanì and Oğuzhan Ersoy},
  journal= {arXiv preprint arXiv:2603.29765},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 Workshop on Scaling Post-training for LLMs