中文

BlockFFN:面向端侧加速友好的块级激活稀疏混合专家模型

机器学习 2025-07-31 v2 计算与语言

摘要

为缓解大型语言模型 (LLM) 的计算负担,具有激活稀疏性的体系结构(如混合专家 MoE)受到日益关注的注意。然而,vanilla MoE 的非可微分且不灵活的路由机制会损害模型性能。此外,尽管每个 token 只激活少数参数,这些稀疏激活架构在块级稀疏性方面表现低下,表明多个连续 token 的联合激活会激活大比例参数。这种稀疏模式不利于在资源有限的条件下(如端侧设备)进行加速,同时与主流加速技术(如 speculative decoding)不兼容。为此,我们引入一种新的 MoE 架构 BlockFFN,以及其高效训练和部署技术。具体而言,我们使用集成 ReLU 激活和 RMSNorm 的路由器实现可微分和灵活的路由。随后,为促进 token 级稀疏性 (TLS) 和块级稀疏性 (CLS),设计了 CLS 感知训练目标,使 BlockFFN 更具加速友好性。最后,我们实现了高效的加速内核,将激活稀疏性与 speculative decoding 首次结合。实验结果表明,BlockFFN 在其他 MoE 基线上表现优异,实现了 80% 以上的 TLS 和 70% 的 8-token CLS。我们的内核在真实端侧设备上比稠密模型快高达 3.67 倍。所有代码和模型 checkpoint 均公开可用(https://github.com/thunlp/BlockFFN)。

关键词

引用

@article{arxiv.2507.08771,
  title  = {BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity},
  author = {Chenyang Song and Weilin Zhao and Xu Han and Chaojun Xiao and Yingfa Chen and Yuxuan Li and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2507.08771},
  year   = {2025}
}

备注

21 pages, 7 figures, 15 tables