中文

LLMs 在线上:数据决定损失-损失规模化定律

机器学习 2026-05-21 v3 人工智能 计算与语言

摘要

规模化定律为大语言模型(LLM)的开发提供了估算模型规模、标记数和计算量之间最佳平衡的依据。更近期地,损失-损失规模化定律(loss-to-loss scaling laws)已成为理解和改进 LLM 性能及其泛化能力的强大工具。本文我们研究哪些因素最强烈地影响损失-损失规模化。我们的实验表明,预训练数据决定了规模化趋势。相比之下,模型规模、优化超参数、标记器以及甚至诸如 Llama 等基于变换器模型与 Mamba 等状态空间模型之间的显著架构差异,通常影响有限。因此,实践者应仔细筛选适合的预训练数据集以获得最佳下游性能,而架构和其他设置可以自由地为训练效率进行优化。

关键词

引用

@article{arxiv.2502.12120,
  title  = {LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws},
  author = {Prasanna Mayilvahanan and Thaddäus Wiedemer and Sayak Mallick and Matthias Bethge and Wieland Brendel},
  journal= {arXiv preprint arXiv:2502.12120},
  year   = {2026}
}

备注

ICML 2025 camera-ready version