BTS:将专业专家融合为通用大语言模型
计算与语言
2025-02-04 v1 机器学习
摘要
我们提出了分支-训练-拼接(Branch-Train-Stitch, BTS),一种高效且灵活的训练算法,用于将独立训练的大语言模型(LLM)专家组合成一个单一且能抑制的通用模型。遵循 Li 等人的做法,我们从单个种子语言模型开始,将其分支为特定领域(如编码或数学)专家,并进行持续预训练。BTS 通过轻量级拼接层将专家组合成通用模型,这些拼接层被插入在冻结的专家与种子 LLM 之间,并在小规模的专家领域数据混合集上进行训练。拼接层使种子 LLM 能够在前向传播期间整合来自任意数量专家的表示,允许其对新领域进行泛化,尽管其自身保持冻结状态。由于 BDS 不会更改组成 LLM 的各个部分,BTS 提供了一种模块化和灵活的方法:专家可以轻松移除,新的专家也只需少量训练即可添加。与替代模型合并方法相比,BTS 在各种下游任务上实现最佳的通用性能,同时保留了每个专家的专业能力。
引用
@article{arxiv.2502.00075,
title = {BTS: Harmonizing Specialized Experts into a Generalist LLM},
author = {Qizhen Zhang and Prajjwal Bhargava and Chloe Bi and Chris X. Cai and Jakob Foerster and Jeremy Fu and Punit Singh Koura and Ruan Silva and Sheng Shen and Emily Dinan and Suchin Gururangan and Mike Lewis},
journal= {arXiv preprint arXiv:2502.00075},
year = {2025}
}