中文

面向大型语言模型后训练量化的硬件感知、分层方法

机器学习 2026-05-15 v1 硬件体系结构

摘要

Scaled Outer Product (SOP) 是一种后训练量化方法,用于大型语言模型权重,旨在硬件上实现每权重 4.5--6 位的接近无损保真度。该方法结合固定和动态码book对的分层搜索,通过分块选择位选择码book,采用带符号的分块尺度,结合激活加权余弦选择,并通过多目标背包提升敏感层,同时包括异常值和稀疏残差校正。固定码book 包括 NF4、BOF4、Split87 和 SH4;分层优化码book (DD4) 存储在 LUT SRAM 中。提出一种新的硬件高效 LUT 输出格式 (HIF),以提高性能、能源和成本。针对六大开源模型族,推荐的 FP6 运行点 (E2M3sUE4M4,6.5 bpw) 在 1.5 bpw 更低的存储成本下,实现了低于常规分层-POT FP8 基线 (E4M3,8.0 bpw) 的更低权重重构误差,表明在 carefully 选择的尺度精度下,块比例小原子可取代传统部署的 FP8。在 4.5--6 bpw 范围内的完整评估,包括层级提升和稀疏残差校正,已在另一篇论文中报告。

关键词

引用

@article{arxiv.2605.14929,
  title  = {A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models},
  author = {Earl Killian},
  journal= {arXiv preprint arXiv:2605.14929},
  year   = {2026}
}

备注

21 pages