中文

理解训练后量化对大语言模型的影响

计算与语言 2023-09-19 v3

摘要

大语言模型(LLMs)的规模迅速增长,参数数量已成为许多商业模型(如 ChatGPT、Claude 和 Bard)成功的关键因素。即便是近期发布的供商业使用的公开可获取模型,如 Falcon 和 Llama2,也配备了数十亿参数。参数数量的显著增长使得部署与运行成本高昂。大神经网络尤其是 LLMs 在量化领域的显著进展,通过使其能部署在消费级 GPU 上而令这些模型更易获取。量化模型通常展现出与未量化基础模型相当的性能水平。然而,我们对这些量化模型如何响应温度、最大新生成 token 数与 topk 等超参数(尤其对于下一词预测)仍缺乏全面理解。本分析揭示,nf4 与 fp4 是同样熟练的 4 位量化技术,具有推理速度、内存消耗与生成内容质量等相似属性。该研究识别出,在较低温度下,nf4 对 llama2 系列模型表现出对温度变化的更强韧性,而 fp4 与 fp4-dq 对 falcon 系列模型是更合适的选择。值得注意的是,一般而言,不同规模的 4 位量化模型在 0.5 至 0.8 的温度范围内比其未量化对应模型对温度更为敏感。此外,int8 量化与显著更慢的推理速度相关,而未量化 bfloat16 模型在各规模模型上始终产生最快的推理速度。

关键词

引用

@article{arxiv.2309.05210,
  title  = {Understanding the Impact of Post-Training Quantization on Large Language Models},
  author = {Somnath Roy},
  journal= {arXiv preprint arXiv:2309.05210},
  year   = {2023}
}