中文

基于算法-系统协同设计的 LLM 高效后训练 INT6 量化——FlexQ

图像与视频处理 2025-08-22 v2

摘要

大型语言模型 (LLM) 表现卓越,但带来显著的内存和计算成本,限制了其实际部署。虽然现有的 INT4/INT8 量化降低了这些成本,但往往会降低准确率或缺乏最佳效率。INT6 量化在模型准确率与推理效率之间提供了更好的平衡点,但缺乏现代 GPU 的硬件支持,迫使通过更高精度的算术单元进行仿真,从而限制加速。在本文中,我们提出了 FlexQ,一种结合算法创新与系统层面优化的新型后训练 INT6 量化框架。FlexQ 在所有层上采用统一的 6 位权重量化,通过层级敏感性分析识别的层保留 8 位激活。为了最大化硬件效率,我们开发了一种专用的高性能 GPU 内核,支持通过 Binary Tensor Core (BTC) 等效实现 W6A6 和 W6A8 表示的矩阵乘法,有效规避了缺乏原生 INT6 张量核心的限制。在 LLaMA 系列模型上的评估显示,FlexQ 能保持接近 FP16 的准确率,WikiText2 上困惑度增加不超过 0.1。该提议内核在 LLaMA-2-70B 线性层上相对于 ABQ-LLM 平均加速 1.39 倍。端到端而言,FlexQ 在 SmoothQuant 之上实现 1.33 倍的推理加速和 1.21 倍的内存节省。代码已发布于 https://github.com/FlyFoxPlayer/FlexQ。

关键词

引用

@article{arxiv.2508.04404,
  title  = {Discriminating Distal Ischemic Stroke from Seizure-Induced Stroke Mimics Using Dynamic Susceptibility Contrast MRI},
  author = {Marijn Borghouts and Richard McKinley and Manuel Köstner and Josien Pluim and Roland Wiest and Ruisheng Su},
  journal= {arXiv preprint arXiv:2508.04404},
  year   = {2025}
}

备注

Accepted to SWITCH2025