为何Pass@k优化会损害Pass@1:LLM后训练中的提示干扰
机器学习
2026-02-27 v2 人工智能
摘要
Pass@k是可验证大型语言模型任务中广泛使用的绩效指标,包括数学推理、代码生成和简答推理。它定义为如果任意k个独立抽样解之一通过验证器,即为成功。这种多采样推理指标激励了直接优化pass@k的推理感知微调方法。然而,先前工作报告称,这类方法下会出现一种持续的权衡:pass@k提高而pass@1下降。这种权衡在实际中至关重要,因为pass@1往往仍是受限于延迟和成本预算、验证器覆盖不完整,以及需要可靠单次备份的硬性约束。我们研究了这种权衡的来源,提供了pass@k策略优化何时会降低pass@1的理论表征,以及由提示干扰引起的梯度冲突。我们展示,pass@k策略梯度可能与pass@1梯度发生冲突,因为pass@k优化隐式地将提示重新加权以强化低成功率的提示;当这些提示被称为负干扰时,其加权会将pass@k更新方向偏离pass@1方向。我们通过在可验证数学推理任务上的大型语言模型实验来说明我们的理论发现。
引用
@article{arxiv.2602.21189,
title = {Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training},
author = {Anas Barakat and Souradip Chakraborty and Khushbu Pahwa and Amrit Singh Bedi},
journal= {arXiv preprint arXiv:2602.21189},
year = {2026}
}
备注
updated related work discussion