中文

AmoebaLLM:构建任意形状的大语言模型以实现高效即时部署

机器学习 2024-11-19 v1 人工智能

摘要

受大语言模型(LLM)在各类自然语言任务中变革性能力的驱动,跨多样化现实应用和平台有效部署这些模型的需求日益增长。然而,由于特定应用的性能要求各异,且计算平台快速演进,具有多样化资源约束和部署流程,高效部署LLM的挑战日益凸显。这些多变的要求需要LLM能够调整其结构(深度和宽度),以在不同平台和应用规格下实现最优效率。为填补这一关键空白,我们提出了AmoebaLLM,一种新颖框架,旨在实现任意形状LLM子网的即时推导,这些子网达到精度-效率前沿,且可在一次性微调后立即提取。因此,AmoebaLLM显著促进了针对各种平台和应用的快速部署。具体而言,AmoebaLLM集成了三个创新组件:(1)一种知识保留的子网选择策略,采用动态规划方法进行深度收缩,采用重要性驱动方法进行宽度收缩;(2)一种形状感知的LoRA混合,以缓解微调期间子网间的梯度冲突;(3)一种带有损失幅度平衡的原地蒸馏方案,作为微调目标。大量实验验证了AmoebaLLM不仅在LLM适应性方面树立了新标准,还成功交付了达到最先进精度-效率权衡的子网。

关键词

引用

@article{arxiv.2411.10606,
  title  = {AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment},
  author = {Yonggan Fu and Zhongzhi Yu and Junwei Li and Jiayi Qian and Yongan Zhang and Xiangchi Yuan and Dachuan Shi and Roman Yakunin and Yingyan Celine Lin},
  journal= {arXiv preprint arXiv:2411.10606},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024