中文

(选择性)舍入到最近浮动量化真的就是我所需要的吗?

机器学习 2025-05-23 v1

摘要

量化成为服务不断增长的大型语言模型(LLM)的必要工具。RTN(Round-to-Nearest)或许是最简单且最古老的量化技术,早于 LLM 崛起成为机器学习(ML)研究前沿。然而,它在几乎每个性能方面都被最新更先进的量化方法所忽视,后者声称在 nearly 方面超越 RTN。本工作旨在 dispel(消解)这种既定观点,表明 RTN 不仅更便宜应用,而且其 token 生成吞吐量可优于更高级的替代方案,准确率也可与之相似。在 particular,我们讨论了基于最新 Marlin kernel 的 RTN 实现,展示了通过 selectively 增加特定模型层和模块的数据精度格式,RTN 的准确率可逐步改进。基于我们的结果,我们认为 RTN 为量化 LLM 提供了可行且实用的选择。

关键词

引用

@article{arxiv.2505.15909,
  title  = {Is (Selective) Round-To-Nearest Quantization All You Need?},
  author = {Alex Kogan},
  journal= {arXiv preprint arXiv:2505.15909},
  year   = {2025}
}