DECO:在端侧设备上实现稀疏混合专家并达到稠密相当性能
机器学习
2026-05-21 v3 计算与语言
摘要
虽然混合专家 (MoE) 在不按比例增加计算的前提下扩大模型容量,但其巨大的总参数占比在存储和内存访问方面造成显著瓶颈,阻碍了端侧部署,而端侧部署需要同时实现高性能、低计算成本和小存储开销。为实现这些属性,我们提出 DECO,一种稀疏 MoE 架构,旨在相同总参数预算和训练标记数下匹配稠密 Transformer 的性能。DECO 利用可微分且灵活的 ReLU 基于路由机制,并通过可学习的专家级缩放自适应平衡路由专家和共享专家的贡献。进一步,我们引入 NormSiLU,这是一种在 SiLU 运算前归一化输入的激活函数,产生更稳定的路由专家激活比率并提高内在稀疏度。我们还识别出使用非门控 MLP 专家配合 ReLU 基于路由的实际优势,表明 MoE 架构的简化可能性。实验表明,DECO 只激活 20% 的路由专家,即可匹配稠密性能并超越既定 MoE 基准。我们的专用加速内核在 Jetson AGX Orin 上相较于稠密推理实现 2.93 的加速。代码和模型权重已提供于 https://github.com/thunlp/DECO。
引用
@article{arxiv.2605.10933,
title = {DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices},
author = {Chenyang Song and Weilin Zhao and Xu Han and Chaojun Xiao and Yingfa Chen and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2605.10933},
year = {2026}
}
备注
15 pages, 10 figures, 12 tables