中文

神经 Scaling 定律的量子化模型

机器学习 2024-01-17 v3 无序系统与神经网络

摘要

我们提出了神经 scaling 定律的量子化模型(Quantization Model),该模型既解释了损失随模型与数据规模呈幂律下降的观测现象,也解释了新能力随规模突然涌现的现象。我们从所谓的量子化假设(Quantization Hypothesis)推导出该模型,即网络知识与技能被“量子化”为离散块(quanta\textbf{quanta})。我们表明,当量子按使用频率递减的顺序被学习时,使用频率中的幂律可解释观测到的损失幂律 scaling。我们在玩具数据集上验证了这一预测,随后研究了大语言模型 scaling 曲线如何分解。利用语言模型梯度,我们自动将模型行为分解为一组多样的技能(量子)。我们初步发现,这些量子在训练分布中的使用频率大致遵循一个幂律,该幂律与语言模型的经验 scaling 指数相对应,这正是我们理论的预测。

关键词

引用

@article{arxiv.2303.13506,
  title  = {The Quantization Model of Neural Scaling},
  author = {Eric J. Michaud and Ziming Liu and Uzay Girit and Max Tegmark},
  journal= {arXiv preprint arXiv:2303.13506},
  year   = {2024}
}

备注

24 pages, 18 figures, NeurIPS 2023