中文

DiscQuant: 受差异理论启发的神经网络量化方法

机器学习 2025-01-14 v1 人工智能 数据结构与算法

摘要

量化神经网络的权重有两个步骤:(1) 为权重找到一个好的低位复杂度表示(我们称之为量化网格),(2) 将原始权重舍入到量化网格中的值。在本文中,我们研究了在给定任何量化网格下的最优舍入问题。最简单且最常用的舍入方法是最近舍入 (RTN)。通过以数据依赖的方式舍入,可以显著提高量化模型的质量。我们从差异理论的角度研究舍入问题,差异理论研究如何在不严重影响解质量的情况下将连续解舍入为离散解。我们证明,给定数据分布中的m=poly(1/ϵ)m=\mathrm{poly}(1/\epsilon)个样本,只要原始模型梯度的空间近似低秩(我们通过实验验证了这一点),我们可以舍入除O(m)O(m)个模型权重之外的所有权重,使得量化模型在真实数据分布上的期望近似误差ϵ\le \epsilon。我们的证明是算法性的,启发了一种简单实用的舍入算法,称为DiscQuant。在我们的实验中,我们证明DiscQuant在Phi3mini-3.8B和Llama3.1-8B的一系列基准测试中显著优于先前最先进的舍入方法GPTQ和基线RTN。例如,使用DiscQuant将Phi3mini-3.8B舍入到每参数3.25比特的固定量化网格,在GSM8k数据集上达到64%的准确率,而GPTQ达到54%,RTN达到31%(原始模型达到84%)。我们在https://github.com/jerry-chee/DiscQuant提供代码。

关键词

引用

@article{arxiv.2501.06417,
  title  = {DiscQuant: A Quantization Method for Neural Networks Inspired by Discrepancy Theory},
  author = {Jerry Chee and Arturs Backurs and Rainie Heck and Li Zhang and Janardhan Kulkarni and Thomas Rothvoss and Sivakanth Gopi},
  journal= {arXiv preprint arXiv:2501.06417},
  year   = {2025}
}