中文

CoSMoEs: 紧凑稀疏专家混合模型

机器学习 2025-03-04 v1 计算与语言

摘要

稀疏专家(MoE)模型在大规模时备受推崇,但在较小规模时仍未得到充分探索。本文展示了如何为在设备上推断实现紧凑稀疏专家混合模型(CoSMoEs)。具体而言,我们针对三个主要的设备端维度:质量、内存和延迟进行了针对性工作。在质量维度上,我们显示,在公平评估(消除混淆因素)下,MoE架构在设备规模方面优于FLOP对齐的稠密模型。我们引入权重分解专家,进一步提高了MoE模型的性能。关于模型内存和延迟,我们显著提高了模型卸载效率,从而降低了模型推断延迟。

关键词

引用

@article{arxiv.2503.00245,
  title  = {CoSMoEs: Compact Sparse Mixture of Experts},
  author = {Patrick Huber and Akshat Shrivastava and Ernie Chang and Chinnadhurai Sankar and Ahmed Aly and Adithya Sagar},
  journal= {arXiv preprint arXiv:2503.00245},
  year   = {2025}
}

备注

11 pages, 8 figures