动态专家专化:面向无灾难性遗忘的多域Mixture-of-Experts适应
机器学习
2025-09-23 v1 人工智能
计算与语言
摘要
Mixture-of-Experts(MoE)模型通过稀疏门控专家子网络提供了巨大的容量,但将其适应到多个领域而不发生灾难性遗忘仍是一个开放问题。现有方法要么计算负担沉重,要么受跨域干扰,要么需要为每个领域分别运行。我们提出DES-MoE,即一种用于Mixture-of-Experts模型多域适应的动态专家专化框架。DES-MoE通过三项创新措施解决灾难性遗忘问题:(1)自适应路由器通过蒸馏平衡预训练知识的保留与任务特定更新;(2)实时专家-域相关性映射以隔离域特定梯度;(3)三阶段自适应微调计划逐步冻结非专化参数。在评估了六个领域(数学、代码、法律等)后,DES-MoE在匹配单域ESFT性能的同时,用一个统一模型完成训练,将与全参数微调相比在域数从2增加到6时遗忘率降低了89%,收敛速度比传统方法快68%。我们的工作确立了动态专家隔离作为多任务MoE适应可扩展范式。
引用
@article{arxiv.2509.16882,
title = {Dynamic Expert Specialization: Towards Catastrophic Forgetting-Free Multi-Domain MoE Adaptation},
author = {Junzhuo Li and Bo Wang and Xiuze Zhou and Xuming Hu},
journal= {arXiv preprint arXiv:2509.16882},
year = {2025}
}
备注
EMNLP 2025 Main Conference