ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing
机器学习
2026-04-01 v2 人工智能
分布式、并行与集群计算
摘要
我们提出 ITQ3_S(Interleaved Ternary Quantization -- Specialized),一种用于大语言模型 (LLM) 的新型 3 位权重量化格式,集成 TurboQuant (TQ),这是一种基于快速沃尔哈赫变换 (FWHT) 的旋转域策略。传统 3 位方法因重尾权重分布和通道间异常值导致精度损失。ITQ3_S 在量化前通过 FWHT 对权重空间进行预旋转,将异常值能量在向量中均匀分布,产生近似高斯分布的分布,便于均匀三进制编码。我们推导了严格的反量化程序,将 256 点逆 FWHT 融入 CUDA shared-memory 加载阶段,确保重构误差仅受三进制量化网格限制,无额外的变换反向误差。对于任意权重向量 ,重构满足 ,严格小于不利用旋转引起的分布归一化的均匀 3 位基准。TurboQuant lacks 原生 CUDA 内核,无法直接部署;粗暴地将 TQ 与现有的权重量化器组合会引入域不匹配误差,这些误差在各层中累积,导致质量低于标准 3 位基准。ITQ3_S 通过将 FWHT 旋转和量化内核协同设计为以 IQ3_S 权重格式为基础的统一管道来解决此问题,并将逆变换融入 CUDA MMQ 内核。实验表明,在 NVIDIA RTX 5090(Blackwell 架构)上,ITQ3_S 实现了与 FP16 相当的困惑度,同时通过优化的 DP4A 和 Tensor Core 调度,吞吐量超过 4 位方案的 1.5 倍。我们的结果将 ITQ3_S 确立为面向消费级硬件的高保真 LLM 部署的实用、数学依据的解决方案。
引用
@article{arxiv.2603.27914,
title = {ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing},
author = {Edward J. Yoon},
journal= {arXiv preprint arXiv:2603.27914},
year = {2026}
}
备注
12 pages, 4 figures, 3 tables