RLVR 中的 Pass@k 指标:一种探索诊断工具,却非优化目标
机器学习
2025-11-21 v1
摘要
大语言模型(Large Language Models, LLMs)执行复杂多步骤推理的能力是现代人工智能研究的核心焦点。为评估和提升这一能力,pass@k 指标——即在 k 次独立抽样中至少获得一个正确解的概率——受到广泛关注。其直观吸引力导致其不仅被用作评估标准,更被直接用作强化学习中的优化目标。本文我们分析了 pass@k 目标,推导了其梯度,表明其本质上是对更简单 pass@1 目标的正重标。我们的分析揭示,pass@k 目标在探索最为关键的领域提供了消散的学习信号。我们进一步分析了“探索坍塌”动力学,表明随着策略将概率质量集中,pass@k 与 pass@1 之间的差距将趋于消失。我们得出结论,尽管 pass@k 是一个有用的诊断工具,但可能不适合作为直接优化目标。相反,明确鼓励高效探索的机制可能为强化学习中推理任务的更有效路径提供可能。
引用
@article{arxiv.2511.16231,
title = {Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective},
author = {Yang Yu},
journal= {arXiv preprint arXiv:2511.16231},
year = {2025}
}