统一 Kaplan 与 Chinchilla 比例定律
机器学习
2024-11-22 v3 计算与语言
摘要
Kaplan 等人 [2020](‘Kaplan')和 Hoffmann 等人 [2022](‘Chinchilla')分别研究了在下一词语言预测任务中训练的变换器模型的比例行为。这些研究得出了关于在给定计算预算()下,参数数量()和训练标记数()应如何设置以实现最小损失的不同估计:Kaplan 提出 ,而 Chinchilla 提出 。本文发现,这一差异很大程度上归因于 Kaplan 计数的是非嵌入参数而非总参数,同时其分析是在小规模下进行的。在这些条件下模拟 Chinchilla 研究会得到接近 Kaplan 的偏斜比例系数。因此,本文通过阐明 Kaplan 原始估计的主要原因,重新确认 Chinchilla 的比例系数。此外,本文解释了损失与计算量之间报告关系差异的原因。这些发现使我们建议未来的比例研究使用总参数和计算量。
引用
@article{arxiv.2406.12907,
title = {Reconciling Kaplan and Chinchilla Scaling Laws},
author = {Tim Pearce and Jinyeop Song},
journal= {arXiv preprint arXiv:2406.12907},
year = {2024}
}
备注
Published in TMLR 2024