Loss-to-Loss 预测:适用于所有数据集的缩放定律
机器学习
2024-11-21 v1 人工智能
计算与语言
机器学习
摘要
虽然缩放定律为预测单一数据分布在不同计算规模下的训练损失提供了可靠的方法,但对于当我们改变分布时这些预测应如何变化,我们知之甚少。在本文中,我们推导了一种从一个损失预测另一个损失的策略,并将其应用于跨不同预训练数据集的预测,以及从预训练数据到下游任务数据的预测。即使在外推至拟合曲线时所用最大 FLOP 预算的 20 倍时,我们的预测依然表现良好。更准确地说,我们发现在以下情况之间存在简单的平移幂律关系:(1)在两个独立数据集上训练的两个模型,当按训练计算量配对时的训练损失(train-to-train);(2)单一模型在任何下游分布上的训练损失与测试损失(train-to-test);(3)在两个独立训练数据集上训练的两个模型的测试损失(test-to-test)。这些结果对于存在显著差异的预训练数据集(一些完全是代码,而另一些完全没有代码)以及各种下游任务均成立。最后,我们发现在某些设置下,这些平移幂律关系可以产生比外推单一数据集缩放定律更准确的预测。
引用
@article{arxiv.2411.12925,
title = {Loss-to-Loss Prediction: Scaling Laws for All Datasets},
author = {David Brandfonbrener and Nikhil Anand and Nikhil Vyas and Eran Malach and Sham Kakade},
journal= {arXiv preprint arXiv:2411.12925},
year = {2024}
}