(选择性)舍入到最近浮动量化真的就是我所需要的吗?
机器学习
2025-05-23 v1
摘要
量化成为服务不断增长的大型语言模型(LLM)的必要工具。RTN(Round-to-Nearest)或许是最简单且最古老的量化技术,早于 LLM 崛起成为机器学习(ML)研究前沿。然而,它在几乎每个性能方面都被最新更先进的量化方法所忽视,后者声称在 nearly 方面超越 RTN。本工作旨在 dispel(消解)这种既定观点,表明 RTN 不仅更便宜应用,而且其 token 生成吞吐量可优于更高级的替代方案,准确率也可与之相似。在 particular,我们讨论了基于最新 Marlin kernel 的 RTN 实现,展示了通过 selectively 增加特定模型层和模块的数据精度格式,RTN 的准确率可逐步改进。基于我们的结果,我们认为 RTN 为量化 LLM 提供了可行且实用的选择。
关键词
引用
@article{arxiv.2505.15909,
title = {Is (Selective) Round-To-Nearest Quantization All You Need?},
author = {Alex Kogan},
journal= {arXiv preprint arXiv:2505.15909},
year = {2025}
}