中文

激发:专家的动量

机器学习 2026-02-26 v1 人工智能

摘要

我们提出 Excitation,一种新型优化框架,旨在加速稀疏架构(如混合专家 MoE)的学习。不同于传统优化器对所有参数一致处理的方式,Excitation 动态地基于批级专家利用率调制更新,引入竞争式更新动态以放大高度利用专家的更新,抑制低利用专家,从而实现路由专化。我们识别到一种“结构混淆”现象在深层 MoE 中存在,标准优化器难以建立功能信号路径;Excitation 作为专化催化剂,“拯救”这些模型,使其在基线卡住的情况下实现稳定训练。Excitation 对优化器、领域和模型皆无感知,集成成本极低,既无额外的 per-parameter 优化器状态,也无可学习参数,因而在资源受限的环境中高度可行。在语言和视觉任务上,Excitation 持续地加快收敛速度并提升最终性能,表明主动更新调制是有效条件计算的关键机制。

关键词

引用

@article{arxiv.2602.21798,
  title  = {Excitation: Momentum For Experts},
  author = {Sagi Shaier},
  journal= {arXiv preprint arXiv:2602.21798},
  year   = {2026}
}