BitStack:可变内存环境下大语言模型的任意尺寸压缩
计算与语言
2025-02-18 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
大语言模型 (LLMs) 已彻底改变了众多应用,但其部署仍受限于本地设备的内存约束。虽然缩放定律增强了 LLM 的能力,但主要瓶颈已从“能力”转向“可用性”,凸显了对高效内存管理的需求。传统的压缩方法(如量化)通常需要预定义的压缩比,并为每种设置进行单独的压缩过程,这使得在可变内存环境中的部署变得复杂。在本文中,我们介绍了 BitStack,这是一种新颖的、无需训练的权重压缩方法,能够在内存使用和模型性能之间实现兆字节级的权衡。通过利用权重分解,BitStack 可以动态调整模型大小,同时在运行内存和存储设备之间进行最小传输。我们的方法在考虑每个参数重要性的同时迭代分解权重矩阵,从而在每次分解迭代中产生大约每个参数 1 比特的残差块。这些块被排序并堆叠在存储中作为基本传输单元,根据当前内存可用性加载不同数量。跨广泛任务的大量实验表明,尽管提供了细粒度的尺寸控制,BitStack 始终匹配或超越了强大的量化基线,尤其是在极端压缩比下。据我们所知,这是第一种有效弥合与量化等实用压缩技术差距的基于分解的方法。代码可在 https://github.com/xinghaow99/BitStack 获取。
引用
@article{arxiv.2410.23918,
title = {BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments},
author = {Xinghao Wang and Pengyu Wang and Bo Wang and Dong Zhang and Yunhua Zhou and Xipeng Qiu},
journal= {arXiv preprint arXiv:2410.23918},
year = {2025}
}
备注
ICLR 2025