中文

MoDification:轻松实现深度混合

计算与语言 2024-10-21 v1 机器学习

摘要

长上下文效率最近成为大语言模型(LLM)服务的热门话题。深度混合(MoD)被提出作为完美的解决方案来降低延迟和内存。然而,在本文中,我们发现MoD几乎无法在不进行大量标记数学习训练的情况下转换现有的LLM。为使从任何LLM到MoD的转换成为可能,我们展示了MoD中top-k算子应提升为阈值-p算子,同时也应精心设计架构和数据。上述所有设计构成了我们称为MoDification的方法。通过覆盖从3B到70B的模型规模的全面实验,我们展示MoDification在效率和效果之间实现了优异的平衡。特别是在长上下文应用中,MoDification可实现约1.2倍的延迟加速和约1.8倍的内存降低。

关键词

引用

@article{arxiv.2410.14268,
  title  = {MoDification: Mixture of Depths Made Easy},
  author = {Chen Zhang and Meizhi Zhong and Qimeng Wang and Xuantao Lu and Zheyu Ye and Chengqiang Lu and Yan Gao and Yao Hu and Kehai Chen and Min Zhang and Dawei Song},
  journal= {arXiv preprint arXiv:2410.14268},
  year   = {2024}
}

备注

12 pages, 9 figures, 5 tables, work in progress