中文

PV-Tuning:超越直通估计的极端 LLM 压缩技术

机器学习 2024-05-31 v2

摘要

极端压缩大型语言模型(LLM),即将参数压缩至 1-2 位,每参数,使其能在资源受限设备上高效运行,近年来受到广泛关注。现有工作聚焦于改进单次量化技术和权重表示方式,但纯后训练方法在准确率与位宽权衡方面已显露乏力。基于量化的方法如 QuIP# 和 AQLM 包括对压缩后参数进行微调,仅限于有限的校准数据;然而,这类在压缩权重上进行的微调技术常仅使用直通估计器(STE),而在此场景下其性能表现尚不明了。本文质疑在极端 LLM 压缩中使用 STE 的做法,证明其可能次优,并系统研究了针对 LLM 的量化感知微调策略。我们提出了 PV-Tuning——一种无表示依赖的框架,概括并改进了现有微调策略,并在受限情形下提供收敛性保证。在实际应用中,针对 1-2 位向量量化,PV-Tuning 在 Llama 和 Mistral 等高性能模型上超越了先前技术。使用 PV-Tuning,我们首次在 Llama 2 系列模型实现 2 位每参数的帕累托最优量化。

关键词

引用

@article{arxiv.2405.14852,
  title  = {PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression},
  author = {Vladimir Malinovskii and Denis Mazur and Ivan Ilin and Denis Kuznedelev and Konstantin Burlachenko and Kai Yi and Dan Alistarh and Peter Richtarik},
  journal= {arXiv preprint arXiv:2405.14852},
  year   = {2024}
}

备注

Preprint