配置到性能比例规律:基于神经网络的 ansatz
机器学习
2026-02-12 v1
摘要
研究人员构建比例规律以预测大规模运行的训练性能,这些运行的模型规模为 N,数据规模为 D。这些比例规律假设其他训练超参数已被最佳选择,这可能需要大量工作,并且在某些情况下由于外部硬件限制而不可行。为提高更广泛超参数范围内的可预测性,并在规模化环境中实现更简单的调参, 我们提出学习一种配置到性能比例规律(Configuration-to-Performance Scaling Law,CPL):从完整训练配置到训练性能的映射。由于没有简单的函数形式可以表达这种映射,我们将其参数化为大型语言模型(LLM),并通过来自多个来源的多样化开源预训练日志进行拟合,得到一种神经配置到性能比例规律(Neural Configuration-to-Performance Scaling Law,NCPL)。NCPL 准确预测了训练配置如何影响最终预训练损失,比配置不敏感的 Chinchilla 比例规律预测误差降低 20-40%,并推广到使用计算量比训练集中任何运行都多出 10 倍的运行。它进一步支持多超参数的联合调优,性能与超参数比例规律基线相当。最后,NCPL 自然且有效地扩展到更丰富的预测目标,如损失曲线预测。
引用
@article{arxiv.2602.10300,
title = {Configuration-to-Performance Scaling Law with Neural Ansatz},
author = {Huaqing Zhang and Kaiyue Wen and Tengyu Ma},
journal= {arXiv preprint arXiv:2602.10300},
year = {2026}
}