4位精度的理由:k位推理缩放定律
机器学习
2023-03-01 v2 神经与进化计算
摘要
量化方法减少了表示模型中每个参数所需的位数,以精度换取更小的内存占用和推理延迟。然而,最终的模型大小取决于原始模型的参数数量和压缩率。例如,一个30B的8位模型和一个60B的4位模型具有相同的总比特数,但可能具有截然不同的零样本精度。在这项工作中,我们通过开发大型语言模型(LLMs)零样本性能的推理缩放定律来研究这种权衡,以确定最大化零样本性能的位精度和模型大小。我们进行了超过35,000次实验,使用16位输入和k位参数,以检验在3到8位精度下,哪些零样本量化方法能在19M到176B参数的规模上,跨BLOOM、OPT、NeoX/Pythia和GPT-2等LLM系列改善缩放性能。我们发现,改善位级缩放权衡具有挑战性,唯一的改进是使用小的块大小——将参数分割成小的独立量化块——以及所使用的量化数据类型(例如,整型与浮点型)。总体而言,我们的研究结果表明,对于总模型位数和零样本精度而言,4位精度几乎普遍是最优的。
引用
@article{arxiv.2212.09720,
title = {The case for 4-bit precision: k-bit Inference Scaling Laws},
author = {Tim Dettmers and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2212.09720},
year = {2023}
}