中文

RSPO:面向 Pass@k 与 Max@k 指标的风险寻求策略优化

机器学习 2025-08-05 v1 人工智能

摘要

当前大型语言模型的后训练优化的是风险中性目标,即最大化预期奖励,但评估高度依赖风险寻求指标,如 Pass@k(k 次尝试中至少一次成功)和 Max@k(k 次响应中最高奖励)。这种风险偏好之间的差异不可避免地导致次优表现。为弥合这一差距,我们提出风险寻求策略优化(RSPO),一种直接针对 Pass@k 与 Max@k 进行训练的方法。优化这些指标的关键挑战是“ hitchhiking”问题:若低奖励响应在 k 次抽样中的某个样本中与高奖励响应同时出现,就会不恰当地强化该低奖励响应,导致优化效率低下。RSPO通过利用给定响应在 k 次抽样中获得最高奖励的闭形式概率来解决此问题。尽管存在对多个响应的嵌套梯度计算复杂性,RSPO仍能为两种指标产生高效、无偏的梯度估计器。我们通过严格的理论分析和全面实验验证了该方法的有效性。

关键词

引用

@article{arxiv.2508.01174,
  title  = {RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models},
  author = {Kaichen Zhang and Shenghao Gao and Yuzhong Hong and Haipeng Sun and Junwei Bao and Hongfei Jiang and Yang Song and Hong Dingqian and Hui Xiong},
  journal= {arXiv preprint arXiv:2508.01174},
  year   = {2025}
}