混合专家模型中的等效性:路由拓扑不决定语言建模质量
人工智能
2026-04-17 v1
摘要
稀疏混合专家(MoE)架构采用越来越复杂的路由机制——学习型路由器、多跳轨迹、基于token的门控。我们提出的问题是:路由拓扑是否实际决定语言建模质量?我们构建了一个几何MoE(ST-MoE),采用余弦相似度路由与低维空间(d_space=64)中的学习型质心进行匹配,路由参数减少80%。通过在WikiText-103上进行62项受控实验(76--84M参数,训练至收敛(50K步,164亿token)),我们发现路由拓扑不决定渐近困惑度(PPL):五种余弦路由变体在1-PPL容差内统计上等价(双侧检验[TOST],p<0.05,对所有10项成对比较均成立;15次运行,观察范围33.93--34.72)。该发现延伸至哈希、随机固定和top-1路由(单次运行;优雅的1.1--2.2 PPL退化)并在OpenWebText上复制(0.03 PPL间隙,6次运行,3个随机种子)。标准线性路由器参数是5.3倍,达到PPL 32.76,但等参数余弦路由缩小了67%的差距——真正的机制优势约为1.2%。机制解释是收敛冗余:多跳更新共线(cos(Δh_0,Δh_1)=0.805),实现幅值放大而非组合推理;一个可学习的标量即可复制多跳性能。作为实际收益,零shot相对范数停止节省25%的MoE FLOPs,仅增加0.12% PPL。专家级专业化与因果可控性——这些与拓扑水平的等效性共存——在另一篇论文中进行了探索。
引用
@article{arxiv.2604.14419,
title = {Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality},
author = {Ivan Ternovtsii and Yurii Bilak},
journal= {arXiv preprint arXiv:2604.14419},
year = {2026}
}