中文

从好奇心到谨慎:基于乐观主义的 Best-of-N 折扣奖励黑客缓解

机器学习 2026-04-07 v1

摘要

推理时间计算规模已成为提高大语言模型在广泛任务上的性能的强大范式,但如何有效利用额外计算仍是一个未解之谜。一种流行的方法是 BoN 采样,即生成 N 个候选响应,根据奖励模型对其进行评分,然后选择得分最高的响应。尽管这种方法可以提高性能,但它容易受到奖励黑客的威胁,即随着 N 的增加,性能会因选择利用奖励模型缺陷而降低,而非真正提高生成质量。先前的尝试通过更强的奖励模型或重度分布正则化来缓解奖励黑客,要么未能完全解决过度优化问题,要么过于保守,无法充分利用额外计算。本文我们探讨了乐观主义原则,即使用价值估计的下置信任区间来避免来自不确定奖励估计的 OOD 动作。我们称之为谨慎的方法:即好奇心的反向过程——好奇心以预测误差作为新奇性信号来奖励,而谨慎则对预测误差进行惩罚,将其作为分布不确定性的信号。实际上,谨慎在典型响应上训练一个误差模型,并利用其预测误差来降低异常响应的奖励估计。我们的广泛实证评估表明,谨慎是一种简单、计算高效的方法,显著缓解了 BoN 采样中的奖励黑客。我们还在简化的线性环境中提供了理论分析,表明谨慎在标准 BoN 方法之上具有可证明的改进。总之,我们的结果不仅将谨慎确立为缓解奖励黑客的实用方法,也为好奇心在大语言模型环境中作为通用 OOD 检测技术提供了证据。

关键词

引用

@article{arxiv.2604.04648,
  title  = {From Curiosity to Caution: Mitigating Reward Hacking for Best-of-N with Pessimism},
  author = {Zhuohao Yu and Zhiwei Steven Wu and Adam Block},
  journal= {arXiv preprint arXiv:2604.04648},
  year   = {2026}
}

备注

29 pages, 8 figures