中文

观察到的规模定律与语言模型性能的可预测性

机器学习 2024-10-03 v3 人工智能 计算与语言 机器学习

摘要

理解语言模型性能随规模的变化对于基准测试和算法开发至关重要。规模定律是一种实现这一理解的方法,但要求在多个不同规模上训练模型的需求限制了其应用。我们提出了一种替代方法,即观察法,绕过模型训练,仅依据约100个公开可得模型构建规模定律。由于不同模型家族在训练计算效率和能力方面存在巨大差异,使用单一规模定律来构建多个模型家族的规模定律具有挑战。然而,我们展示了这些差异符合一种简单的、通用的规模定律,即语言模型性能是低维能力空间的函数,只有模型家族在将训练计算转化为能力方面的效率有所不同。通过这一方法,我们展示了复杂规模现象的惊人可预测性:我们展示了多个涌现现象遵循平滑的S型行为,可从小模型中预测;我们展示了像 GPT-4 这样的模型代理性能可从更简单的非代理基准中精确预测;我们展示了如何预测后训练干预(如链式思考和自我一致性)对语言模型能力持续提升的影响。

关键词

引用

@article{arxiv.2405.10938,
  title  = {Observational Scaling Laws and the Predictability of Language Model Performance},
  author = {Yangjun Ruan and Chris J. Maddison and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2405.10938},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024 as a spotlight