中文

SiLQ:简单的大语言模型量化感知训练

机器学习 2025-07-24 v1 人工智能 计算与语言

摘要

大语言模型可以通过量化来降低推理时延、模型尺寸和能耗,从而以更低的成本提供更好的用户体验。在合理时间内交付精度损失最小的量化模型是一项挑战,特别是要在不引入与专用推理加速器不兼容机制的前提下实现这一点。在此,我们展示了一种简单的端到端量化感知训练方法,在总模型训练预算增加不到0.1%的情况下,该方法在多个现代基准测试上大幅优于已发表的最领先量化方法,且同时适用于基础模型和指令模型变体。该方法易于泛化到不同的模型架构,可应用于激活值、缓存和权重,且除了量化本身之外,无需向模型引入任何额外操作。

关键词

引用

@article{arxiv.2507.16933,
  title  = {SiLQ: Simple Large Language Model Quantization-Aware Training},
  author = {Steven K. Esser and Jeffrey L. McKinstry and Deepika Bablani and Rathinakumar Appuswamy and Dharmendra S. Modha},
  journal= {arXiv preprint arXiv:2507.16933},
  year   = {2025}
}

备注

12 pages, 3 figures