中文

揭示 1-bit 神经网络缩放背后的理论

机器学习 2024-11-05 v1 人工智能 计算复杂性 计算与语言

摘要

最近,1-bit 大语言模型(LLM)涌现,展现出与传统 LLM 相媲美的高效性与性能的显著结合。Wang 等人(2023)和 Ma 等人(2024)的研究表明,随着参数量增加,1-bit LLM 的性能逐步提升,暗示 1-bit 神经网络可能存在缩放定律。本文给出了为 1-bit 模型严格建立这一缩放定律的首个理论结果。我们证明,尽管权重被限制在 {1,+1}\{-1, +1\},但随着网络宽度增长,模型训练动态必然与核行为对齐。这一理论突破保证了 1-bit 模型在宽度增加时收敛到任意小的损失。此外,我们引入了泛化差异的概念,定义为 1-bit 网络与其全精度对应网络输出之间的差距,并证明随着网络宽度缩放,这一差异保持在可忽略水平。基于 Kaplan 等人(2020)的工作,我们进一步考察训练损失如何作为模型规模、数据集规模和训练计算资源的幂律函数进行缩放。我们的发现凸显了缩放 1-bit 神经网络的巨大潜力,表明 int1 可能成为未来神经网络精度的标准。

关键词

引用

@article{arxiv.2411.01663,
  title  = {Unlocking the Theory Behind Scaling 1-Bit Neural Networks},
  author = {Majid Daliri and Zhao Song and Chiwun Yang},
  journal= {arXiv preprint arXiv:2411.01663},
  year   = {2024}
}