动态重铸专家:混合专家模型中持续性rerouting以实现更佳在线适应
计算与语言
2025-10-17 v1
摘要
混合专家 (MoE) 模型通过稀疏专家激活实现高效扩展,但常因部署中的分布迁移导致路由决策次优。虽然现有测试时适应方法可能解决这些问题,但主要针对密集模型且需要外部数据,限制了其对 MoE 架构的实际适用性。然而,我们发现不依赖参考数据,即可仅凭输入上下文对 MoE 专家选择进行优化。因此,我们提出一种数据无关、在线测试时框架,持续在文本生成期间适应 MoE 路由决策,无需外部监督或数据。该方法在两个阶段之间循环:在 prefill 阶段,以及在定期间隔后,我们基于已生成序列的自监督优化模型的路由决策。然后正常生成文本,维持修改后的路由器,直至下次适应。我们通过仅更新所选层路由器 logits 的轻量添加向量来实现这一点,在保持计算效率的同时防止过度适应。实验结果显示,在具有挑战性推理任务上,方法持续获得性能提升,同时对上下文迁移保持鲁棒性。例如,该方法在 OLMoE 上实现了 5.5% 的提升。由于其即插即用特性,该方法自然地补充现有的测试时扩展技术,例如在 DeepSeek-V2-Lite 上实现 6% 的平均提升。
引用
@article{arxiv.2510.14853,
title = {Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models},
author = {Guinan Su and Yanwu Yang and Li Shen and Lu Yin and Shiwei Liu and Jonas Geiping},
journal= {arXiv preprint arXiv:2510.14853},
year = {2025}
}