中文

Matryoshka 量化

机器学习 2025-03-04 v3 人工智能

摘要

对模型权重进行量化是减少大模型通信和推理成本的关键步骤。然而,对模型进行量化——尤其是对 int4 或 int2 等低精度——需要在模型质量之间进行权衡;int2 尤其已知会严重降低模型质量。因此,实践者往往被迫维持多个具有不同量化水平的模型,或服务一个最能满足质量-延迟权衡的单一模型。另一方面,整数数据类型(如 int8)本质上具有嵌套(Matryoshka)结构,其中较小的位宽整数(如 int4 或 int2)嵌套在最有效位中。利用这一洞察力,本文提出了 Matryoshka 量化(MatQuant),一种新型多尺度量化技术,以缓解上述挑战。该技术允许我们训练和维护单个量化模型,但根据部署需求以所需精度服务它。此外,利用 MatQuant 的共训练和共蒸馏正则化,提取的 int2 精度模型在以 OmniQuant 和 QAT 为基本算法时,分别比标准 int2 量化高出最高可达 4% 和 7%。最后,我们演示,通过使用一个额外的位来表示异常值,一个有效精度为 2.05 位的模型可为以 OmniQuant 为基本算法的模型提供额外的 6% 改进。

关键词

引用

@article{arxiv.2502.06786,
  title  = {Matryoshka Quantization},
  author = {Pranav Nair and Puranjay Datta and Jeff Dean and Prateek Jain and Aditya Kusupati},
  journal= {arXiv preprint arXiv:2502.06786},
  year   = {2025}
}