中文

评估最佳-N抽样策略在语言模型对齐中的表现

计算与语言 2025-02-19 v1

摘要

最佳-N抽样(Best-of-N, BoN)结合奖励模型已被证明为一种有效的语言模型(LLM)对齐策略。然而,BoN抽样易受到奖励作弊问题的影响。由于奖励模型是真实目标的 imperfect proxy,对其价值过度优化可能损害其在真实目标上的性能。Jinnai 等人(2024)提出了正则化BoN抽样(Regularized BoN, RBoN),通过对目标函数进行正则化处理,证明其优于传统BoN抽样,能够抑制奖励作弊并在实验中取得优异结果。然而,Jinnai 等人(2024)的方法基于经验法则,缺乏对为何正则化策略能提升BoN抽样性能的分析。本研究旨在分析BoN抽样对正则化策略的影响。将正则化策略对应于鲁棒优化,即在代理奖励的可能扰动集合上最大化最坏情况。虽然理论保证不能直接适用于RBoN,但RBoN对应于一种实际实现。本文提出了RBoN框架的扩展,称为随机RBoN抽样(Stochastic RBoN, SRBoN),这是一种针对代理奖励最坏情况RBoN的理论保证方法。我们随后在AlpacaFarm和Anthropic的hh-rlhf数据集上进行实证评估,以评估哪些正则化因素有助于提升真实代理奖励的性能。此外,我们还提出了另一种简单的方法——句子长度正则化BoN(Sentence Length Regularized BoN),在实验中表现优于先前方法。

关键词

引用

@article{arxiv.2502.12668,
  title  = {Evaluation of Best-of-N Sampling Strategies for Language Model Alignment},
  author = {Yuki Ichihara and Yuu Jinnai and Tetsuro Morimura and Kaito Ariu and Kenshi Abe and Mitsuki Sakamoto and Eiji Uchibe},
  journal= {arXiv preprint arXiv:2502.12668},
  year   = {2025}
}