中文

基于影响驱动的极端低位 LLM 量化中的谱旋转

机器学习 2026-05-26 v1 人工智能 计算机科学中的逻辑

摘要

我们应用了来自副理论论文(arXiv:2605.01637)的影响自适应Walsh几何,对极端低位权重仅 LLM 量化进行操作。该配方是一种数学不变变换:对每个线性层的权重矩阵进行WHT旋转,并对其列按每个坐标的Walsh基激活能进行比例缩放,然后交给重建误差量化器(Intel auto-round)。这会偏向高谱能通道的per-group整数四舍五入。在135M至1.5B参数的四个预训练解码器模型上,BBT-spectral相对于vanilla auto-round在W2A16情形下降低了wikitext-2困惑度,降幅为15-58%;我们也报告了一个TinyLlama-1.1B的辅助数据点。三个扩展将该配方转移到它原本失败的模型族:对Qwen3注意力(q_norm/k_norm)进行per-head PCA矩阵-Gamma替换(在Qwen3-0.6B上PPL从136.76降至88.99);以及一种与RoPE交换的SO(2) per-pair旋转(在Qwen2.5-1.5B上PPL从36.93降至21.84);以及一种通过Laguna风格的fused-expert布局架构模糊测试识别的MoE感知的输入侧吸收修复。W2与W4的消除实验给出一种刻意的负控制:在W4情形下,重新分配的收益落在±0.5 PPL噪声声浪范围内,与对噪声预算收缩时无浓度影响成本消失的谢尔森凸性直觉相符。所有量化权重均导出至OpenVINO IR,在Intel NPU + Arc dGPU + CPU上运行时,PPL对设备在±0.1范围内保持不变。我们不声称该理论论文的主要化整性论证的布尔值到实数值的正式传递:本文使用的WHT激活能并非该理论论文中的布尔影响,链接是直观的,贡献是工程价值而非移植定理。针对SpinQuant、QuaRot、QuIP-sharp、AQLM、OmniQuant和ButterflyQuant在匹配校准下的头盾基准测试是主要的未来工作项目。

关键词

引用

@article{arxiv.2605.25203,
  title  = {Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization},
  author = {Gorgi Pavlov},
  journal= {arXiv preprint arXiv:2605.25203},
  year   = {2026}
}

备注

14 pages, no figures. Companion application paper to arXiv:2605.01637 (theory). Code and pinned eval stack: https://github.com/gogipav14/spectral-llm