中文

超越 Pass@k:推理边界的广度-深度度量

人工智能 2025-10-22 v2 计算与语言 机器学习

摘要

基于可验证奖励的强化学习(RLVR)已成为提高大型语言模型在编码、数学或逻辑等推理任务性能的强大范式。为评估模型能解决问题的比例(即推理边界),研究者通常报告大采样预算下的 Pass@k。近期结果揭示了交叉现象:尽管 RLVR 模型在小 k 值下优于基础模型,但当采样大量完成项时,基础模型通常表现更好。这被解释为基础模型拥有更大推理边界的证据。我们认为,在答案空间为离散的任务(如数值输出的数学问题)上,大 k 值下的 Pass@k 反映的是在试验次数极限情况下的成功概率提升,而非真正的推理能力,因此可能具有误导性。我们提出了 Cover@tau 指标,其衡量模型解决问题的比例——即至少有 tau 比例的完成项正确。与 Pass@k 不同,Cover@tau 在明确可靠性阈值的前提下捕捉推理表现:依赖随机猜测的模型会随着 tau 增大而迅速退化。我们使用 Cover@tau 基于指标评估了多个 RLVR 模型,并展示了相对于 Pass@1 的流行算法排名发生变化,提供了关于推理边界的不同视角。

关键词

引用

@article{arxiv.2510.08325,
  title  = {Beyond Pass@k: Breadth-Depth Metrics for Reasoning Boundaries},
  author = {Marius Dragoi and Ioana Pintilie and Florin Gogianu and Florin Brad},
  journal= {arXiv preprint arXiv:2510.08325},
  year   = {2025}
}

备注

10 pages, 3 figures. v2 adds discussion of related work (G-Pass@k)