Mixture of Experts 的 $\mu$ 参数化
机器学习
2025-10-10 v2
摘要
近年来,随着大型语言模型 (LLM) 的日益增长的兴趣和采纳,混合专家 (Mixture-of-Experts, MoE) 架构正成为极大模型中的领先架构。目前,最大的开源模型已达到超过 T 参数。在此规模下,超参数调谐变得不可行。正因如此,迁移正在成为关键技术。它允许在不同模型规模之间无缝地传递最优超参数,从而大幅降低调谐成本。然而,现有工作主要聚焦于稠密 LLM,尚未探索 MoE 架构。本文为 MoE 提出参数化,为跨模型宽度的特征学习提供理论保证。我们的实验表明,最优学习率可可靠地跨越模型大小进行传递,为大规模 MoE 模型的高效超参数调谐奠定了基础。
引用
@article{arxiv.2508.09752,
title = {$\mu$-Parametrization for Mixture of Experts},
author = {Jan Małaśnicki and Kamil Ciebiera and Mateusz Boruń and Maciej Pióro and Jan Ludziejewski and Maciej Stefaniak and Michał Krutul and Sebastian Jaszczur and Marek Cygan and Kamil Adamczewski and Jakub Krajewski},
journal= {arXiv preprint arXiv:2508.09752},
year = {2025}
}