面向细粒度混合专家模型的自适应倒排索引路由
机器学习
2026-05-07 v1
摘要
混合专家模型 (Mixture-of-experts, MoE) 通过每个 token 仅激活部分专家来实现可扩展的 Transformer 架构。最近的证据表明,随着专家粒度增加(即用许多小专家代替少数大专家),性能会得到提升。然而,这种机制会大幅增加路由开销,使其可能主导计算过程。我们引入了 MoE 的自适应倒排索引路由 (adaptive inverted-index routing for MoE, AIR-MoE),这是一种受倒排索引启发、基于向量量化 (vector quantization, VQ) 的路由架构。在第一阶段,AIR-MoE 通过将 token 分配给 VQ 码字来构建候选专家集,执行粗粒度初筛。在第二阶段,细粒度评分仅在此初筛列表内计算精确的路由分数。这种两阶段过程在避免对所有专家进行评分的同时,近似实现了真正的 top-k 路由,且与先前工作不同的是,它不对专家参数施加任何结构约束。AIR-MoE 可作为标准路由器的直接替代品,无需修改模型架构或损失函数。我们进一步给出了 AIR-MoE 所实现的质量召回率的下界,这为其内部机制提供了深刻见解。实验表明,在细粒度 MoE 设置下,AIR-MoE 与现有路由方法相比取得了更好的性能。
引用
@article{arxiv.2605.04952,
title = {Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts},
author = {Klaus-Rudolf Kladny and Maximilian Mordig and Bernhard Schölkopf and Michael Muehlebach},
journal= {arXiv preprint arXiv:2605.04952},
year = {2026}
}