中文

ExpertWeaver:基于GLU激活模式解锁稠密LLM内在的MoE

计算与语言 2026-02-18 v1 机器学习

摘要

混合专家(MoE)通过稀疏专家激活有效扩展模型容量,同时保持计算效率。然而,从头训练高质量MoE代价高昂。一个有前景的替代方案是将预训练稠密模型转换为稀疏MoE。现有的稠密到MoE方法分为两类:动态结构修剪将稠密模型转换为稀疏MoE架构以平衡性能和推理效率,downcycling方法使用预训练稠密模型初始化高度稀疏MoE架构。然而,现有方法破坏稠密模型中固有的激活模式,导致专家构建次优。本文我们认为,门控线性单元(GLU)机制为稠密到MoE转换提供了自然的蓝图。我们表明,GLU的细粒度神经激活模式揭示了粗粒度结构,发现由持续激活的通用神经元和动态激活的专用神经元组成的内在MoE架构。利用这一发现,我们引入ExpertWeaver,一个无训练框架,根据激活模式对神经元进行分区,并构建具有层自适应配置的共享专家和路由专家。我们的实验表明,ExpertWeaver在作为无训练动态结构修剪技术和MoE初始化的downcycling策略方面显著优于现有方法。

关键词

引用

@article{arxiv.2602.15521,
  title  = {ExpertWeaver: Unlocking the Inherent MoE in Dense LLMs with GLU Activation Patterns},
  author = {Ziyu Zhao and Tong Zhu and Zhi Zhang and Tiantian Fan and Jinluan Yang and Kun Kuang and Zhongyu Wei and Fei Wu and Yu Cheng},
  journal= {arXiv preprint arXiv:2602.15521},
  year   = {2026}
}