FlexMoRE:用于高效联邦训练大型语言模型的灵活混合专家模型
机器学习
2026-02-10 v1
摘要
近期的混合专家架构进展表明,个别专家模型可通过使用常见基模型进行协调,以孤立方式训练其他专家。然而,我们假设完整尺寸的专家对所有领域都非必需,低秩适配器可能足够。本文介绍 FlexMoRE,即灵活的秩异构专家混合模型,可为全尺寸专家或合适秩数的适配器。我们系统性地研究了专家秩与下游任务性能之间的权衡,通过评估 个秩为 到 的专家, resulting in 150 个实验组合(96 个两专家组合,54 个七专家组合),这些组合在 120 个任务上进行评估。对于我们的实验,我们基于 FlexOlmo 将其预训练的专家转化为低秩版本。我们的回归分析从专家秩到下游任务性能揭示,推理密集型基准测试的最佳表现秩显著高于知识密集型基准测试的最佳表现秩。这些关于秩灵敏度的发现伴随着直接的内存效率影响:在最优秩的条件下,FlexMoRE 在平均得分 47.18 的下游任务性能优于采用全尺寸专家的基线 FlexOlmo-style 混合模型(平均得分 45.46),参数数量仅为其三分之一(FlexMoRE 为 10.75B,而 FlexOlmo 为 33.27B)。所有代码将公开提供。
引用
@article{arxiv.2602.08818,
title = {FlexMoRE: A Flexible Mixture of Rank-heterogeneous Experts for Efficient Federatedly-trained Large Language Models},
author = {Annemette Brok Pirchert and Jacob Nielsen and Mogens Henrik From and Lukas Galke Poech and Peter Schneider-Kamp},
journal= {arXiv preprint arXiv:2602.08818},
year = {2026}
}