中文

AdaBoN:自适应最佳-N 对齐

计算与语言 2026-03-16 v3 人工智能 机器学习

摘要

基于扩散模型的测试时对齐方法,如最佳-N 抽样,提供了一种简单且有效的方法,通过奖励模型(RM)引导语言模型(LM)实现偏好行为。然而,这些方法在统一应用于提示词而不考虑对齐难度差异时,可能造成计算成本高昂。本文提出了一种面向提示词的自适应最佳-N 对齐策略,以更高效地分配推理计算资源。受延迟考虑的启发,我们开发了两阶段算法:初始探索阶段以小预算估算每个提示词的奖励分布,第二阶段则基于这些估计自适应分配剩余预算。该方法简单实用,兼容任意 LM-RM 组合。实验在 AlpacaEval、HH-RLHF 和 PKU-SafeRLHF 数据集上的 12 对 LM/RM 组合和 50 个不同批次提示词上进行,结果表明我们的自适应策略在相同推理预算下优于均匀分配。而且,我们展示了自适应策略在推理预算扩大 20% 时仍能与均匀分配相抗衡,并且随着批次规模的增大,性能提升。

关键词

引用

@article{arxiv.2505.12050,
  title  = {AdaBoN: Adaptive Best-of-N Alignment},
  author = {Vinod Raman and Hilal Asi and Satyen Kale},
  journal= {arXiv preprint arXiv:2505.12050},
  year   = {2026}
}

备注

25 pages