中文

超越模型结构与规模的层级熵加权量化普遍性

机器学习 2025-03-10 v2 人工智能

摘要

本文提出一种新型的选择性模型量化方法,超越面向大语言模型(LLM)的架构特定和规模依赖压缩方法,采用熵加权量化(Entropy-Weighted Quantization, EWQ)。通过分析Transformer模块间的熵分布,EWQ确定可在不显著降低性能的前提下安全量化的模块,独立于模型架构或规模。我们的方法超越统一量化方案,在保持Massive Multitask Language Understanding(MMLU)准确率不足0.5%的同时,将内存使用降低最高18%。我们在多个架构(1.6B至70B参数)上展示了EWQ的有效性,无论模型规模或架构设计,均实现质量-压缩权衡的一致性改进。EWQ的一个意外发现是其能够较未量化模型降低困惑度,这暗示了通过选择性精度降低实现的有益正则化。这种改进跨越不同模型家族,表明层级熵与最优精度需求之间存在根本性关系。此外,我们引入FastEWQ,一种快速的熵分布分析方法,无需加载模型权重即可实现近乎即时的量化决策,同时保持80%的分类准确率。我们的结果表明,有效的量化策略可独立于特定的架构选择或模型规模开发,为高效部署LLM开辟了新可能。

关键词

引用

@article{arxiv.2503.04704,
  title  = {Universality of Layer-Level Entropy-Weighted Quantization Beyond Model Architecture and Size},
  author = {Alireza Behtash and Marijan Fofonjka and Ethan Baird and Tyler Mauer and Hossein Moghimifam and David Stout and Joel Dennison},
  journal= {arXiv preprint arXiv:2503.04704},
  year   = {2025}
}

备注

29 pages, 7 figures, 14 tables; Fixed some types, added some clarifications and improvements