中文

混合专家 Transformer 中的多头注意力作为灾难性遗忘来源

人工智能 2026-05-28 v2

摘要

混合专家(MoE)架构常被视为持续学习的自然匹配,因为稀疏路由应能局部化更新并减少干扰,但即便如此,MoE Transformer 在稀疏且均衡的专家利用下仍会出现显著遗忘。我们将这一差距归因于前置路由瓶颈:多头注意力将头特定信号拼接为单个注意力后路由器输入,迫使路由器针对共现特征组合而非可分离的头通道进行路由。我们展示了,这一路由器输入同时编码了多个可分别解码的语义和结构因素,且不同特征组合诱导弱对齐的参数-梯度方向;结果是,路由将许多不同的组合映射到同一路由。我们通过路由级有效组成数 NeffN_{eff} 对此碰撞效应进行量化,并发现更高的 NeffN_{eff} 与持续训练后旧任务损失增加相关。迎合这些发现,我们提出了 MH-MoE,通过对头级子表征进行路由来增加路由粒度并减少组成碰撞。在 TRACE 上使用 Qwen3-0.6B/8B 测试中,MH-MoE 有效缓解了遗忘现象,BWT 在 Qwen3-0.6B 上从 11.2%(LoRAMoE)降至 4.5%。

关键词

引用

@article{arxiv.2602.12586,
  title  = {Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models},
  author = {Joshua Ong Jun Leang and Yu Zhao and Mihaela Cătălina Stoian and Wenda Li and Shay B. Cohen and Eleonora Giunchiglia},
  journal= {arXiv preprint arXiv:2602.12586},
  year   = {2026}
}

备注

8 pages, ICML2026