按序列排序专家,而非按标记
机器学习
2026-03-30 v2 人工智能
信息论
math.IT
摘要
Mixture-of-Experts(MoE)架构通过仅激活每个标记的一部分专家来扩展大型语言模型(LLM),但标准的 TopK 路由为所有标记分配固定数量的专家,忽略其各自复杂性的差异。先前的自适应路由方法引入额外的模块和超参数,通常需要从头重新训练。我们提出了序列级 TopK(SeqTopK),一种最小化的修改,将专家预算从标记层面转移到序列层面。通过选择所有 个标记中前 个专家,SeqTopK 实现了端到端学习的动态分配——为难以处理的标记分配更多专家,为简单标记分配较少专家——同时保持相同的总体预算。SeqTopK 只需几行代码,开销不足 1%,且完全兼容预训练的 MoE 模型。实验在数学、编码、法律和写作等领域均显示,相较于 TopK 和先前无参数自适应方法,SeqTopK consistently 提供改进,且在稀疏度更高时(最高达 16.9%)提升更为显著。这些结果表明,SeqTopK 是一种简单、高效且可扩展的路由策略,特别适用于下一代大型语言模型的极端稀疏场景。代码已在 https://github.com/Y-Research-SBU/SeqTopK 上提供。
引用
@article{arxiv.2511.06494,
title = {Route Experts by Sequence, not by Token},
author = {Tiansheng Wen and Yifei Wang and Aosong Feng and Long Ma and Xinyang Liu and Yifan Wang and Lixuan Guo and Bo Chen and Stefanie Jegelka and Chenyu You},
journal= {arXiv preprint arXiv:2511.06494},
year = {2026}
}