局部专家混合:通过模型合并实现几乎无测试时间训练
机器学习
2025-07-31 v2 人工智能
摘要
专家混合(MoE)模型是一种通过增加模型容量而不增加推理成本的有前景方法,是许多最先进语言模型的核心组件。然而,当前的 MoE 模型通常仅使用少量专家,因训练和推理成本而受限。我们提出测试时间模型合并(TTMM),将 MoE 范式扩展至数量级更多专家,并利用模型合并几乎消除测试时间开销。我们表明 TTMM 是测试时间训练(TTT)的近似,即为每个预测任务(即提示)微调专家模型。TTT 最近已被证明显著提升语言模型,但计算成本高昂。我们发现 TTMM 的性能随专家数量的增加而提升,并趋近于 TTT 的性能。此外,我们发现以 1B 参数为基础模型的 TTMM 在测试时间比 TTT 快 100 倍以上,通过在训练时间来摊薄 TTT 的成本。因此,TTMM 为规模化测试时间训练提供了具有竞争力的成本效益方法。
引用
@article{arxiv.2505.14136,
title = {Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging},
author = {Ryo Bertolissi and Jonas Hübotter and Ido Hakimi and Andreas Krause},
journal= {arXiv preprint arXiv:2505.14136},
year = {2025}
}