best-of-n 对齐策略的理论保证
机器学习
2025-05-30 v3 计算与语言
信息论
math.IT
摘要
一种用于生成模型推理时对齐和扩展测试时计算的简单而有效的方法是 best-of- 采样,即从参考策略中抽取 个样本,基于奖励函数进行排序,并选择排名最高的一个。文献中一个常用的解析表达式声称,best-of- 策略与参考策略之间的 KL 散度等于 。我们否定了这一说法的有效性,并证明它是实际 KL 散度的一个上界。我们还探讨了该上界在不同区域下的紧致性,并提出了一种新的 KL 散度估计器,并通过实验证明它提供了一个紧致的近似。我们还证明了 best-of- 策略相对于参考策略的胜率上界为 ,并推导了该刻画紧致性的界限。最后,我们分析了 best-of- 对齐策略在胜率与 KL 散度之间的权衡,结果表明,在 的情况下可以实现非常好的权衡。
引用
@article{arxiv.2401.01879,
title = {Theoretical guarantees on the best-of-n alignment policy},
author = {Ahmad Beirami and Alekh Agarwal and Jonathan Berant and Alexander D'Amour and Jacob Eisenstein and Chirag Nagpal and Ananda Theertha Suresh},
journal= {arXiv preprint arXiv:2401.01879},
year = {2025}
}
备注
ICML 2025