中文

Spectra:大规模预训练三值语言模型的惊人效果

机器学习 2024-10-14 v5 人工智能 计算与语言

摘要

GPU 计算能力的快速进步已超过内存容量和带宽的增长速度,导致大型语言模型(LLM)推理中的内存瓶颈。后训练量化是解决 LLM 推理内存瓶颈的主流方法,但在 4 位以下精度时会出现显著性能下降。本文通过调查低位宽模型的预训练,特别是三值语言模型(TriLM),作为传统浮点模型(FloatLM)及其后训练量化版本(QuantLM)的替代方案。我们提出 Spectra LLM 套件,首个覆盖多种位宽的开源 LLM 套件,包括 FloatLM、QuantLM 和 TriLM,参数规模从 990 万到 39 亿,训练数据为 3000 亿 token。我们的全面评估表明,TriLM 在模型大小(以位为单位)方面表现出优异的扩展行为。在超过 10 亿参数的规模下,TriLM 在各种基准测试中一致优于相同位宽的 QuantLM 和 FloatLM。值得注意的是,39 亿参数的 TriLM 在所有基准测试中匹配 FloatLM 39 亿参数的性能,尽管其位数少于 FloatLM 8.3 亿参数。总体而言,本研究为低位宽语言模型的可行性和可扩展性提供了宝贵见解,为开发更高效的 LLM 铺平了道路。为增进对低位宽模型的理解,我们将在 https://github.com/NolanoOrg/SpectraSuite 上发布 500 多个中间检查点。

关键词

引用

@article{arxiv.2407.12327,
  title  = {Spectra: Surprising Effectiveness of Pretraining Ternary Language Models at Scale},
  author = {Ayush Kaushal and Tejas Vaidhya and Arnab Kumar Mondal and Tejas Pandey and Aaryan Bhagat and Irina Rish},
  journal= {arXiv preprint arXiv:2407.12327},
  year   = {2024}
}

备注

42 pages, 21 figures, and 13 tables