中文

Read-ME:将 LLM 重构为路由器解耦的混合专家模型与系统协同设计

计算与语言 2024-10-28 v1 机器学习

摘要

大型语言模型(LLM)的激增导致了混合专家(MoE)架构的采用,该架构动态利用专门的子网络以提高效率和性能。尽管有这些优势,MoE 模型在推理过程中面临重大挑战,包括低效的内存管理和次优的批处理,这是由于模型架构与系统策略之间的设计选择不一致所致。此外,从头训练 MoE 的传统方法在成本上越来越难以承受。在本文中,我们提出了一种新颖的框架 Read-ME,将预训练的稠密 LLM 转换为更小的 MoE 模型(与“升级”通用 MoE 相反),避免了从头训练的高成本。我们的方法利用激活稀疏性来提取专家。为了组合专家,我们检查了广泛采用的逐层路由器设计并展示了其冗余性,因此我们引入了与 MoE 主干解耦的预门控路由器,便于系统友好的预计算和前瞻调度,增强了专家感知的批处理和缓存。因此,我们的协同设计解决了算法和系统方面的关键差距,为资源受限环境中的 LLM 推理建立了一种可扩展且高效的替代方案。Read-ME 优于其他类似规模的热门开源稠密模型,在 MMLU 上实现了高达 10.1% 的提升,并将平均端到端延迟降低了高达 6.1%。代码可在 https://github.com/VITA-Group/READ-ME 获取。

关键词

引用

@article{arxiv.2410.19123,
  title  = {Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design},
  author = {Ruisi Cai and Yeonju Ro and Geon-Woo Kim and Peihao Wang and Babak Ehteshami Bejnordi and Aditya Akella and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2410.19123},
  year   = {2024}
}

备注

38th Conference on Neural Information Processing Systems (NeurIPS 2024)