中文

ScaleBITS:面向硬件对齐的混合精度LLM可扩展位宽搜索

机器学习 2026-04-29 v2 软件工程

摘要

后训练权重量化对于降低大语言模型(LLMs)的内存和推理成本至关重要,但因高度非均匀的权重灵敏度和缺乏原则化的精度分配而难以将平均精度压到4位以下。现有解决方案采用不规则细粒度混合精度,导致高运行开销,或依赖启发式方法或高度受限的精度分配策略。本文提出ScaleBITS,一个在内存预算下实现自动化、细粒度位宽分配的混合精度量化框架,同时保持硬件效率。我们提出新的灵敏度分析方法,引入硬件对齐的块级权重分区方案,配合双向通道重排序。我们将全局位宽分配建模为受约束的优化问题,并开发了可扩展的贪心算法近似求解,实现端到端原则化分配。实验表明,ScaleBITS在均匀精度量化上显著提升(最高+36%),并在 ultra-low-bit regime下超越最新感知灵敏度基线(最高+13%),且无需增加运行时开销。

关键词

引用

@article{arxiv.2602.17697,
  title  = {Pimp My LLM: Leveraging Variability Modeling to Tune Inference Hyperparameters},
  author = {Nada Zine and Clément Quinton and Romain Rouvoy},
  journal= {arXiv preprint arXiv:2602.17697},
  year   = {2026}
}