更快、更小、更智能:面向在线 MoE 推理的任务感知专家合并
机器学习
2026-01-26 v2
摘要
稀疏专家混合模型 (SMoE) 已成为在不增加计算成本的情况下扩展 Transformer 容量的首选架构,因为它对每个输入仅激活少量专家。然而,将该方法部署于在线推理仍具有挑战性,原因在于完整 SMoE 模型规模庞大且专家路由复杂,尤其是在资源受限的边缘网络中。此外,在线推理过程中任务信息往往不可用,使得任务级路由容易出错。在本工作中,我们提出了一种新型树结构自适应神经 bandit 路由器 Tanbr,以实现高效可靠的在线 MoE 推理。Tanbr 不依赖显式任务标签,而是从历史数据中估计任务分布,并利用其指导给定预训练 MoE 内的任务感知专家合并。为处理合并权重的连续大空间,Tanbr 采用二叉树逐步划分空间并生成更精细的候选权重。随后应用神经 bandit 学习合并权重到模型性能的非线性映射,并决定最优专家合并。我们证明 Tanbr 在连续决策空间上实现了 sublinear 遗憾界 O(√T log T),尽管操作于连续决策空间,其遗憾界与现有方法相当。大量实验表明,Tanbr 将推理延迟至少降低 45%,内存使用最多降低 25%,同时在准确率方面与许多最先进方法保持较高水平。
引用
@article{arxiv.2509.19781,
title = {Faster, Smaller, and Smarter: Task-Aware Expert Merging for Online MoE Inference},
author = {Ziyi Han and Xutong Liu and Ruiting Zhou and Xiangxiang Dai and John C. S. Lui},
journal= {arXiv preprint arXiv:2509.19781},
year = {2026}
}