UltraSketchLLM:基于显著性绘制的超低位LLM压缩
机器学习
2025-06-24 v1 人工智能
摘要
大型语言模型(LLM)的快速增长已超出边缘设备的存储限制,因此需要超越1比特极限的极端权重压缩。虽然量化可以减小模型大小,但其本质上受限于每权重1比特。现有的多对一压缩方法要么依赖映射表(导致内存开销),要么因随机权重分组而导致严重的精度下降。我们提出了UltraSketchLLM,一个无索引、基于绘制的框架,可在保持模型性能的同时实现超低位压缩(低至每权重0.5比特)。UltraSketchLLM利用数据绘制(一种来自流式应用的次线性表示技术)将多个权重映射到具有有界误差的单个值。我们的方法集成了低估AbsMaxMin绘制以最小化小权重的相对误差、重要性感知的空间分配以优先处理显著权重,以及用于压缩感知微调的直通估计器。在Llama-3.2-1B上的实验表明,在实现高达0.5比特压缩的同时,保持了有竞争力的困惑度,并伴有可容忍的延迟开销。UltraSketchLLM为在资源受限环境中部署LLM提供了一种实用解决方案。
引用
@article{arxiv.2506.17255,
title = {UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression},
author = {Sunan Zou and Ziyun Zhang and Xueting Sun and Guojie Luo},
journal= {arXiv preprint arXiv:2506.17255},
year = {2025}
}