揭示 1-bit 神经网络缩放背后的理论
机器学习
2024-11-05 v1 人工智能
计算复杂性
计算与语言
摘要
最近,1-bit 大语言模型(LLM)涌现,展现出与传统 LLM 相媲美的高效性与性能的显著结合。Wang 等人(2023)和 Ma 等人(2024)的研究表明,随着参数量增加,1-bit LLM 的性能逐步提升,暗示 1-bit 神经网络可能存在缩放定律。本文给出了为 1-bit 模型严格建立这一缩放定律的首个理论结果。我们证明,尽管权重被限制在 ,但随着网络宽度增长,模型训练动态必然与核行为对齐。这一理论突破保证了 1-bit 模型在宽度增加时收敛到任意小的损失。此外,我们引入了泛化差异的概念,定义为 1-bit 网络与其全精度对应网络输出之间的差距,并证明随着网络宽度缩放,这一差异保持在可忽略水平。基于 Kaplan 等人(2020)的工作,我们进一步考察训练损失如何作为模型规模、数据集规模和训练计算资源的幂律函数进行缩放。我们的发现凸显了缩放 1-bit 神经网络的巨大潜力,表明 int1 可能成为未来神经网络精度的标准。
引用
@article{arxiv.2411.01663,
title = {Unlocking the Theory Behind Scaling 1-Bit Neural Networks},
author = {Majid Daliri and Zhao Song and Chiwun Yang},
journal= {arXiv preprint arXiv:2411.01663},
year = {2024}
}