中文

Spectra 1.1: 三元语言模型的缩放定律与高效推理

机器学习 2025-07-01 v1 人工智能

摘要

大型语言模型在研究和工业应用中的使用日益广泛,但其推理效率仍然是一个重大挑战。随着现代GPU架构计算能力的持续提升,其内存带宽和容量并未按比例扩展,从而在推理过程中形成了关键瓶颈。为了解决这个问题,我们研究了采用量化感知训练以显著降低内存需求的三元语言模型。我们首先通过缩放定律分析来研究TriLM的可扩展性,揭示出TriLM从增加训练数据中获益比从扩大模型参数中获益更多。基于这一观察,我们引入了Spectra-1.1,一个在多达1.2万亿token上训练的开源TriLM套件,展示了在大规模下的持续性能提升。此外,为了提高推理效率,我们为三元权重提出了新颖的2比特和1.6比特打包方案,这些方案在各种CPU架构上展示了加速推理的效果。同时,基于2比特打包,我们开发了一个名为TriRun的GPU内核,与浮点基线相比,它将端到端模型推理速度提升了高达5倍。为了鼓励对TriLM的进一步探索和开发,我们将发布Spectra-1.1套件和TriRun推理内核。总的来说,我们的工作为构建和部署高效LLM奠定了基础,为研究社区提供了宝贵的资源。

关键词

引用

@article{arxiv.2506.23025,
  title  = {Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models},
  author = {Tejas Vaidhya and Ayush Kaushal and Vineet Jain and Francis Couture Harpin and Prashant Shishodia and Majid Behbahani and Yuriy Nevmyvaka and Irina Rish},
  journal= {arXiv preprint arXiv:2506.23025},
  year   = {2025}
}