中文

测试时扩展使过度训练成为计算最优

机器学习 2026-04-03 v1 计算与语言 机器学习

摘要

现代大语言模型(LLM)在测试时进行扩展,例如通过重复采样,推理成本随模型规模和样本数量增长。这造成了Chinchilla等预训练扩展定律未涉及的权衡。我们提出了Train-to-Test (T²)扩展定律,在固定端到端预算下联合优化模型规模、训练token数量和推理样本数量。T²通过用于测试时扩展的pass@k建模现代化了预训练扩展定律,然后联合优化预训练和测试时决策。T²的预测在不同的建模方法下均稳健:衡量联合扩展效应对任务损失的影响以及建模效应对任务准确率的影响。在八个下游任务上,我们发现当考虑推理成本时,最优预训练决策急剧移入过度训练区域,远在标准预训练扩展套件范围之外。我们通过在T²扩展预测的最优区域中预训练严重过度训练的模型来验证结果,确认其性能显著优于仅预训练扩展。最后,由于前沿LLM经过后训练,我们证明我们的发现在后训练阶段仍然成立,使T²扩展在现代部署中具有意义。

关键词

引用

@article{arxiv.2604.01411,
  title  = {Test-Time Scaling Makes Overtraining Compute-Optimal},
  author = {Nicholas Roberts and Sungjun Cho and Zhiqi Gao and Tzu-Heng Huang and Albert Wu and Gabriel Orlanski and Avi Trost and Kelly Buchanan and Aws Albarghouthi and Frederic Sala},
  journal= {arXiv preprint arXiv:2604.01411},
  year   = {2026}
}