EoRA:基于特征空间低秩近似的压缩大语言模型免微调补偿方法
计算与语言
2026-03-18 v6 人工智能
摘要
尽管训练后压缩技术能有效减少大语言模型(LLM)的内存占用、延迟和功耗,但它们通常会导致明显的精度下降,并受限于硬件和内核约束,限制了支持的压缩格式——最终降低了在广泛部署场景中的灵活性。在这项工作中,我们提出了 EoRA——一种新颖的免微调方法,通过低秩矩阵增强压缩后的 LLM,使用户能够快速提升特定任务的性能,并在压缩格式的限制之外自由平衡精度与计算开销之间的权衡。在恢复压缩 LLM 精度方面,EoRA 始终优于先前的免微调低秩方法,取得了显著的精度提升(例如,对于压缩至 3 比特的 LLaMA3-8B,在 ARC-Challenge 上提升 10.84%,在 MathQA 上提升 6.74%,在 GSM8K 上提升 11.45%)。我们还引入了一个优化的 CUDA 内核,通过量化 EoRA 将推理速度提升高达 1.4 倍并减少内存开销。总体而言,EoRA 为在不同用户需求下提高压缩模型精度提供了一种即时解决方案,实现了更高效、更灵活的 LLM 部署。代码可在 https://github.com/NVlabs/EoRA 获取。
引用
@article{arxiv.2410.21271,
title = {EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation},
author = {Shih-Yang Liu and Maksim Khadkevich and Nai Chit Fung and Charbel Sakr and Chao-Han Huck Yang and Chien-Yi Wang and Saurav Muralidharan and Hongxu Yin and Kwang-Ting Cheng and Jan Kautz and Yu-Chiang Frank Wang and Pavlo Molchanov and Min-Hung Chen},
journal= {arXiv preprint arXiv:2410.21271},
year = {2026}
}
备注
ICLR 2026 workshops. Code: https://github.com/NVlabs/EoRA