FlexQuant:面向边缘设备上本地部署 LLM 的弹性量化框架
人工智能
2025-01-14 v1 性能
摘要
在边缘设备上部署 LLM presents 严重的技术挑战。内存弹性对于具有统一内存的边缘设备至关重要,其中内存是共享的且动态波动。现有解决方案要么导致过粗的转换粒度,要么造成高存储成本。我们提出了 FlexQuant,一种新颖的弹性框架,通过生成一套量化模型,提供具备 15 倍粒度提升和 10 倍存储降低的弹性托管解决方案。FlexQuant 可与大多数量化方法配合工作,通过我们的修剪方法,在各种存储限制下创建一系列权衡选项。这为 LLM 的边缘部署带来了极大的性能和灵活性。
引用
@article{arxiv.2501.07139,
title = {FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices},
author = {Yuji Chai and Mujin Kwen and David Brooks and Gu-Yeon Wei},
journal= {arXiv preprint arXiv:2501.07139},
year = {2025}
}