中文

统一 Kaplan 与 Chinchilla 比例定律

机器学习 2024-11-22 v3 计算与语言

摘要

Kaplan 等人 [2020](‘Kaplan')和 Hoffmann 等人 [2022](‘Chinchilla')分别研究了在下一词语言预测任务中训练的变换器模型的比例行为。这些研究得出了关于在给定计算预算(CC)下,参数数量(NN)和训练标记数(DD)应如何设置以实现最小损失的不同估计:Kaplan 提出 NoptimalC0.73N_\text{optimal} \propto C^{0.73},而 Chinchilla 提出 NoptimalC0.50N_\text{optimal} \propto C^{0.50}。本文发现,这一差异很大程度上归因于 Kaplan 计数的是非嵌入参数而非总参数,同时其分析是在小规模下进行的。在这些条件下模拟 Chinchilla 研究会得到接近 Kaplan 的偏斜比例系数。因此,本文通过阐明 Kaplan 原始估计的主要原因,重新确认 Chinchilla 的比例系数。此外,本文解释了损失与计算量之间报告关系差异的原因。这些发现使我们建议未来的比例研究使用总参数和计算量。

关键词

引用

@article{arxiv.2406.12907,
  title  = {Reconciling Kaplan and Chinchilla Scaling Laws},
  author = {Tim Pearce and Jinyeop Song},
  journal= {arXiv preprint arXiv:2406.12907},
  year   = {2024}
}

备注

Published in TMLR 2024