中文

HARP:面向极端 LLM 量化的哈达德-预条件自适应旋转处理器

机器学习 2026-05-29 v1 人工智能

摘要

后训练量化(PTQ)是部署 LLM 在内存和带宽受限条件下的关键技术。然而,极端低位量化对激活离群值和非各向异性权重曲率极其敏感。现有基于不协调性的 PTQ 方法通过固定随机哈达德变换(RHT)来缓解此问题,这些变换虽提高了量化鲁棒性,但无法根据层、校准分布或量化器自适应旋转基。我们引入HARP(Hadamard-preconditioned Adaptive Rotation Processor),一种可学习的结构化双面正交处理器,取代固定的哈达德混合,同时保持与全精度完全等价。HARP 将每个旋转表示为稀疏翅膀状块正交阶段的乘积,支持非二次幂维度的混合进制方案,并初始化为RHT处理器至固定置换。仅基于校准数据拟合,HARP可为每个层和后端自适应量化基。对于1B至70B参数的模型,在2-4位设置下,HARP相较于固定RHT在困惑度和零样本准确率上均取得改进。重要的是,HARP保持部署效率,达到128 token/s,而FP16仅为61 token/s。

关键词

引用

@article{arxiv.2605.29843,
  title  = {HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization},
  author = {Artur Zagitov and Gleb Molodtsov and Aleksandr Beznosikov},
  journal= {arXiv preprint arXiv:2605.29843},
  year   = {2026}
}