中文

Any-Precision LLM:多个不同尺寸LLM的低成本部署

机器学习 2024-06-24 v4

摘要

最近,大量的努力被投入到压缩大型语言模型(LLM)中,这些模型在各种应用中展现出突破性的能力,但由于其庞大的尺寸而带来显著的部署成本。与此同时,尽管部署多个不同尺寸的LLM具有实际意义,但用于缓解与此相关的成本问题却受到少得多的关注。因此,本文引入了any-precision LLM,将any-precision DNN的概念扩展到LLM。为了解决any-precision LLM中的挑战,我们提出了一种轻量级的LLM any-precision量化方法,利用了训练后量化框架,并开发了专门的软件引擎以实现高效服务。因此,我们的解决方案通过将量化为不同位宽(如3、4、……、nn位)的LLM叠加为与单个nn位LLM相当的内存占用,显著降低了部署多个不同尺寸LLM的高昂成本。所有支持的不同位宽LLM均展现出最先进的模型质量和推理吞吐量,证明其自身是部署多个不同尺寸LLM的极具吸引力的选择。我们的代码已开源并在线提供。

关键词

引用

@article{arxiv.2402.10517,
  title  = {Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMs},
  author = {Yeonhong Park and Jake Hyun and SangLyul Cho and Bonggeun Sim and Jae W. Lee},
  journal= {arXiv preprint arXiv:2402.10517},
  year   = {2024}
}

备注

To appear at ICML 2024. Code is available at https://github.com/SNU-ARC/any-precision-llm