最佳mini-N循环内采样:基于上下文质量奖励模型的可靠且高效的最佳-N采样
统计方法学
2025-10-14 v2 人工智能
机器学习
摘要
现代偏好对齐技术,如最佳-N(BoN)采样,依赖于使用两两比较数据训练的奖励模型。虽然有效于学习相对偏好,但这一范式未能捕捉响应可接受性的信号,使系统易受选择“最差的坏选项”的风险。对于难题提示,随着采样数量的增加,这种假可接受性风险也随之增大。本文通过引入新的数据收集和建模框架来解决这一关键可靠性缺口。通过在偏好数据中增添外部选项,灵感来自离散选择模型,我们训练奖励模型,既能区分“更好”之物,亦能区分“足够好”之物。我们利用这一能力创建了一种自适应推断策略,即mini-N循环内最佳,从而将生成预算划分为顺序循环,并施加校准的早期退出条件。我们的实验表明,当用作对齐警戒线时,可将可靠性失败率降低70%;当用作推断加速器时,在IMDB情感设置下可将平均推断速度提高22%以上。我们因此为实践者提供了一个原则且灵活的框架,以显式管理可靠性与计算效率之间的权衡。
引用
@article{arxiv.2510.04087,
title = {Best of mini-N in-loop Sampling: A Contextual Quality Reward Model for Reliable and Efficient Best-of-N Sampling},
author = {Hyung Gyu Rho and Sian Lee},
journal= {arXiv preprint arXiv:2510.04087},
year = {2025}
}