中文

FairyFuse:通过融合三值核实现 CPU 上的无乘法 LLM 推理

机器学习 2026-04-24 v1

摘要

大型语言模型日益部署在CPU-only平台上,内存带宽是自回归生成的主要瓶颈。权重量化至4位以下可减轻内存压力,但现有系统仍需反量化权重并执行浮点乘法,限制了可达的性能提升。三值权重{-1, 0, +1}提供更高效的替代方案,将乘法替换为条件加、减或无操作。虽然Fairy2i表明三值LLM可匹配FP16质量,但其运行时未充分利用这种结构。我们提出FairyFuse,推出一种在商品CPU上实现无乘法执行的推理系统,通过融合每个广义线性层的8个真值子GEMV于单个AVX-512循环中,使用掩码加法和减法,实现零浮点乘法。Roofline分析表明,16倍权重压缩将内存受限的GEMV推向计算受限区间,实现29.6倍内核速度提升,而在GPU上几乎无益。端到端而言,FairyFuse在单颗Intel Xeon 8558P上实现32.4个token/秒,凭近乎无损质量(WikiText-2 BPC 5.52 vs. 5.47 FP16;下游准确率66.0%),超越llama.cpp Q4_K_M 1.24倍。

关键词

引用

@article{arxiv.2604.20913,
  title  = {FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels},
  author = {Fei Zuo and Xiaoyan Xi and Quanyi Zeng and Feiyu Wang and Ho Fai Leung},
  journal= {arXiv preprint arXiv:2604.20913},
  year   = {2026}
}

备注

16 pages, 10 figures, 4 tables