中文

专家之汤:通过参数平均预训练专家模型

机器学习 2025-02-05 v1 计算与语言

摘要

机器学习模型通常在不同数据域的混合数据上进行训练。不同的域权重会产生截然不同的下游性能。我们提出了专家之汤(Soup-of-Experts),这是一种新颖的架构,能够在测试时以最小的计算成本为任意域权重实例化一个模型,且无需重新训练模型。我们的架构由一个专家参数库组成,这些参数通过线性组合来实例化一个模型。我们学习线性组合系数,将其作为输入域权重的函数。为了训练此架构,我们采样随机的域权重,实例化相应的模型,并通过使用这些域权重采样的一批数据进行反向传播。我们展示了我们的方法如何在多个语言建模任务上快速获得小型专用模型。当需要在模型大小约束下快速交付许多不同的专家模型时,专家之汤尤其具有吸引力。

关键词

引用

@article{arxiv.2502.01804,
  title  = {Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging},
  author = {Pierre Ablin and Angelos Katharopoulos and Skyler Seto and David Grangier},
  journal= {arXiv preprint arXiv:2502.01804},
  year   = {2025}
}