UniPool:面向混合专家模型的全局共享专家池
机器学习
2026-05-08 v1 人工智能
摘要
现代混合专家模型架构通过严格的逐层规则分配专家容量:每个 Transformer 层拥有独立的专家集合。这一惯例将深度扩展与专家参数的线性增长耦合在一起,并假设每一层都需要隔离的专家容量。然而,近期的分析以及我们的路由探测对这一分配规则提出了挑战:在多个生产级 MoE 模型中,将深层网络学习到的 top-k 路由替换为均匀随机路由,下游准确率仅下降 1.0-1.6 个百分点。受此冗余现象启发,我们提出了 UniPool,一种将专家容量视为全局架构预算的 MoE 架构,它以单一共享池取代逐层专家所有权,并由独立的逐层路由器进行访问。为了在共享机制下实现稳定且均衡的训练,我们引入了池级辅助损失以平衡整个池中的专家利用率,并采用 NormRouter 提供面向共享专家池的稀疏且尺度稳定的路由。在基于 Pile 数据集中 30B tokens 训练的五种 LLaMA 架构模型规模(182M、469M、650M、830M 和 978M 参数)上,与匹配的原始 MoE 基线相比,UniPool 持续改善了验证损失和困惑度。在这些规模下,UniPool 相对于原始 MoE 最多将验证损失降低了 0.0386。除了原始损失的提升外,我们的结果还将池大小确定为显式的深度扩展超参数:仅使用原始专家参数预算 41.6%-66.7% 的减池 UniPool 变体,在测试规模上能够匹配或超越逐层 MoE。这表明,在共享池设计下,专家参数无需随深度线性增长;它们可以呈次线性增长,同时保持比原始 MoE 更高的效率与有效性。进一步分析表明,UniPool 的优势可与更细粒度的专家分解相叠加。
引用
@article{arxiv.2605.06665,
title = {UniPool: A Globally Shared Expert Pool for Mixture-of-Experts},
author = {Minbin Huang and Han Shi and Chuanyang Zheng and Yimeng Wu and Guoxuan Chen and Xintong Yu and Yichun Yin and Hong Cheng},
journal= {arXiv preprint arXiv:2605.06665},
year = {2026}
}