推理时对齐中的最佳-N 方法:覆盖范围、规模与最优性
人工智能
2025-04-09 v2 机器学习
机器学习
摘要
推理时计算为扩大语言模型性能提供了强大的扩展轴。然而,仅仅增加计算量在诸如最佳-N 采样等技术中,可能导致绩效下降,因 reward hacking。为了理论上理解如何充分利用额外计算,我们聚焦于推理时对齐问题,将其形式化为:给定感兴趣的提示并访问不完美的 reward model,提高从 pre-trained policy 中抽取的响应质量。我们从两个维度(i)响应质量,和(ii)计算量来分析推理时对齐算法的性能,并提供新的结果,突出显示 pre-trained policy 对高质量响应的覆盖范围对于性能和计算规模至关重要:1. 我们指出,仅当 N 选择得当时,最佳-N 对齐可在严格的覆盖条件下实现最优性能,但当 N 较大时会因 reward hacking 而受损,且在更现实的覆盖条件下难以获得紧密保证。2. 我们引入 InferenceTimePessimism(推理时悲观主义),一种通过故意利用推理时计算来缓解 reward hacking 的新算法,通过采用面对不确定性的悲观原则进行拒绝抽样;我们证明其性能最优且随 N 不会下降,即具备 scaling-monotonic 特性。我们补充理论结果,随后进行实验评估,展示 InferenceTimePessimism 在各种任务和模型上的优势。
引用
@article{arxiv.2503.21878,
title = {Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment},
author = {Audrey Huang and Adam Block and Qinghua Liu and Nan Jiang and Akshay Krishnamurthy and Dylan J. Foster},
journal= {arXiv preprint arXiv:2503.21878},
year = {2025}
}