中文

基于代理引导的主动预算分配:高效缩放定律估计

机器学习 2026-05-26 v2

摘要

预测模型在更大规模下的性能可为特定性能目标设计训练策略和体系结构。经验缩放定律研究识别函数形式以辅助此预测任务。这些描述性模型使用由学习曲线定义的损失-计算前沿来描述损失与计算之间的关系。由于该方法的经验性质,计算负担巨大,使得战略资源分配至关重要——但这仍然令人惊讶地未得到充分探索。本文我们通过探讨成功削减 (Successive Halving, SH) 和 SH 结合参数和非参数代理模型的适合性来解决这一不足。除了使给定计算预算的分配更为系统化,我们的发现表明,SH 配合代理模型可获得一组学习曲线,其中一个在损失-计算值上低于朴素均匀分配或仅用 SH 方法可获得的值。我们的实验显示,在真实世界和合成学习曲线数据集上,分别实现最高达 2.84% 和 5.47% 的平均相对改进。这一战略资源分配使我们能够以显著降低的计算成本获得准确的缩放定律,节省最高可达 98.7% 相对于传统穷举方法的成本。

关键词

引用

@article{arxiv.2605.17234,
  title  = {Active Budget Allocation for Efficient Scaling Law Estimation via Surrogate-Guided Pruning},
  author = {Viktoria Schram and Markus Hiller and Daniel Beck and Trevor Cohn},
  journal= {arXiv preprint arXiv:2605.17234},
  year   = {2026}
}

备注

Accepted at ICML 2026