Huff-LLM:面向高效大语言模型推理的端到端无损压缩方法
机器学习
2025-02-04 v1 硬件体系结构
摘要
随着能力日益增强,大语言模型(LLMs)的规模持续快速增长,这加剧了在小型边缘设备上运行最先进大语言模型的难度。标准技术主张通过量化或剪枝等有损压缩技术来解决此问题。然而,这类压缩技术是有损的,且已被证明会以不可预测的方式改变模型行为。我们提出 Huff-LLM,一种端到端的无损模型压缩方法,允许用户将大语言模型权重以压缩格式存储在任何地方——云端、磁盘、主内存,甚至片上内存/缓冲区。这不仅使我们能在主内存中加载更大的模型,还减少了将权重加载到片上所需的带宽,并更高效地利用片上权重缓冲区。除了通过压缩节省内存外,我们还展示了使用压缩模型进行推理时在延迟和能效方面的改进。
引用
@article{arxiv.2502.00922,
title = {Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference},
author = {Patrick Yubeaton and Tareq Mahmoud and Shehab Naga and Pooria Taheri and Tianhua Xia and Arun George and Yasmein Khalil and Sai Qian Zhang and Siddharth Joshi and Chinmay Hegde and Siddharth Garg},
journal= {arXiv preprint arXiv:2502.00922},
year = {2025}
}