大型语言模型 Pass@k 扩展预测的高效方法
人工智能
2025-10-08 v1 机器学习
应用统计
机器学习
摘要
评估前沿人工智能系统的能力与风险是当前研究的关键领域,最近的研究表明,从模型中进行多次抽样可以显著提升两者。例如,多次抽样被证明可以提高模型的能力,如解决困难的数学和编程问题,但也被证明会增加其潜在危害,如被越狱。这些结果引出了一个对于能力和安全预测的关键问题:在给定极小的抽样预算的情况下,如何准确预测当模型被扩展到大量尝试时的行为?这一问题直接关系到模型提供者(每天服务数亿用户)以及寻求预防危害的政府监管机构。为回答此问题,我们做出三项贡献。首先,我们发现用于拟合这些规律的标准方法存在统计缺陷,尤其在数据有限的场景下会阻碍预测准确性。其次,我们通过引入基于贝塔-二项分布的鲁棒估计框架来弥补这些缺陷。最后,我们提出一种动态抽样策略,对更难的问题分配更大的预算。结合这些创新,本文能够以更低的计算成本,对罕见的风险和能力进行更可靠的预测。
引用
@article{arxiv.2510.05197,
title = {Efficient Prediction of Pass@k Scaling in Large Language Models},
author = {Joshua Kazdan and Rylan Schaeffer and Youssef Allouah and Colin Sullivan and Kyssen Yu and Noam Levi and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2510.05197},
year = {2025}
}