any4:面向大语言模型的学习型 4 位数值表示
机器学习
2025-07-08 v1 人工智能
摘要
我们提出了 any4,一种用于大语言模型 (LLMs) 的学习型 4 位权重量化解决方案,提供任意数值表示,无需对权重或激活进行预处理。any4 在模型大小、生成和系列 (Llama 2、Llama 3、Mistral 和 Mixtral) 上评估的其他相关 4 位数值表示类型 (int4、fp4 和 nf4) 中表现出更高的准确率。尽管 any4 不需要对权重或激活进行预处理,但它也与需要此类预处理的正交技术 (例如 AWQ 和 GPTQ) 具有竞争力。我们还实验了 any3 和 any2,显示在更低位数上的竞争性。此外,我们展示可以使用单个精选多样化样本进行校准,而不像大多数量化方法那样需要来自数据集的数百个样本。我们还开源了 tinygemm,一个针对 LLMs 的低延迟 GPU 矩阵乘法库,实现 any4 使用 GPU 高效查找表策略以及其他常见量化方法。我们在 https://github.com/facebookresearch/any4 上开源代码。
引用
@article{arxiv.2507.04610,
title = {any4: Learned 4-bit Numeric Representation for LLMs},
author = {Mostafa Elhoushi and Jeff Johnson},
journal= {arXiv preprint arXiv:2507.04610},
year = {2025}
}
备注
ICML 2025