中文

XFP:面向 LLM 推理的稀疏异常值分离质量目标自适应码本量化

机器学习 2026-05-15 v1 人工智能

摘要

我们引入了 XFP,一个用于 LLM 推理的动态权重量化器,它颠覆了传统工作流程:操作员指定逐通道余弦相似度上的重建质量下限(注意力与共享专家设一个严格下限,路由专家 MoE 设一个宽松下限);XFP 自动确定每层的码本大小、异常值预算和打包方式——无需 Hessian 矩阵、无需校准数据、无需手动选择位宽。每个权重矩阵被分解为稀疏的 fp16 异常值残差和密集的子字节索引张量,指向逐组学习的码本。两种存储模式共享一个自动选择前端和一个融合解码内核:V2(逐通道 Lloyd)和 V2a(每层 L=32 个码本的共享库)。在 V2 模式下的 Qwen3.5-122B-A10B 上,XFP 在工作站硬件(RTX PRO 6000 Blackwell,TP=2)上实现了 138 tok/s 的单流解码速度,GSM8K 严格匹配率达 94.49%(3 个随机种子,n=3957),且在 TP=1 时比 Marlin INT4 快 49%。对于无法放入目标内存范围的模型,我们提出了 H-Process:对两个余弦阈值进行质量驱动的迭代,以找到模型刚好能放入且仍能产生合理输出的工作点。三个约束定义了其搜索空间:操作员设定的阈值、加载时量化(quantize-on-load)的 OOM 边界,以及生成时的垃圾边界(余弦相似度导向;基准验证)。在 Qwen3.5-397B-A17B(512 个路由专家/层)上,H-Process 将全部专家群体放入 2x96 GB 内存中,有效位宽约为 3.4 位,并在完整的 1319 题问题集上实现了 100.9 tok/s 的长输出解码速度,GSM8K 严格匹配率达 66.72%(提交时为单随机种子;多种子评估正在进行中),在内存、吞吐量和准确率上同时超越了采用路由专家剪枝的 INT4。

关键词

引用

@article{arxiv.2605.14844,
  title  = {XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference},
  author = {Thomas Witt},
  journal= {arXiv preprint arXiv:2605.14844},
  year   = {2026}
}

备注

17 pages, 3 figures, 17 tables, 1 algorithm. Code: https://github.com/flash7777/vllm/tree/multiquant