中文

推理尺度律的简单模型

机器学习 2024-12-10 v2 人工智能 信息论 机器学习 math.IT

摘要

神经网络尺度律因其能够预测随参数、数据和计算量增加而产生的模型性能而引起广泛关注。本文提出一种基于记忆的简单统计猜想,用于研究推理场景中的尺度律,具体涉及性能随多次推理尝试次数的提升情况。我们探讨覆盖率(即 pass@k 指标),该指标衡量多次尝试成功的机会,并为大型语言模型(LLM)在推理任务中表现出的覆盖率函数形式提供了解释。随后,我们定义了“推理损失”,其随尝试次数增加呈现幂律衰减,并将其结果与提示成本相联系。我们进一步通过在简单生成模型上进行实验测试,发现我们的预测在受控环境下的经验覆盖率曲线与之一致。我们的简单框架为将推理尺度律与其他已知尺度律结合奠定了基础。

关键词

引用

@article{arxiv.2410.16377,
  title  = {A Simple Model of Inference Scaling Laws},
  author = {Noam Levi},
  journal= {arXiv preprint arXiv:2410.16377},
  year   = {2024}
}

备注

12 pages, 7 figures