IsoQuant:面向硬件的 SO(4) 等距旋转用于 LLM KV 缓存压缩
机器学习
2026-03-31 v1 计算与语言
摘要
正交特征去相关对低位宽在线向量量化效果良好,但稠密随机正交变换导致 的存储和计算开销。RotorQuant 通过块状 3D Clifford 旋转来降低成本,但所得到的 3D 分区与现代硬件对齐不佳,局部混合效果有限。我们提出了 **IsoQuant**,一种基于四元数代数和 等距分解的块状旋转框架。它将每个 4D 块表示为四元数,并应用闭式变换 。这产生两个主要变体:IsoQuant-Full 实现完整的 旋转,而 IsoQuant-Fast 仅保留一个等距因子以降低成本;该框架还支持轻量级的 2D 特殊情况。在 时,IsoQuant-Full 将 RotorQuant 中的前向旋转成本从约 次 FMA 降低至 ,而 IsoQuant-Fast 进一步降低至 。在 18 组融合 CUDA 设置中(,位宽 ,FP16/FP32 执行),IsoQuant 在 RotorQuant 上实现约 -- 的平均内核级加速,保持可比的重构 MSE,峰值加速可超过 。当前验证仅限于合成标准化向量的分词-反分词路径;端到端 KV 缓存评估仍是未来工作。
引用
@article{arxiv.2603.28430,
title = {IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression},
author = {Zhongping Ji},
journal= {arXiv preprint arXiv:2603.28430},
year = {2026}
}
备注
11 pages