基于贝叶斯偏好学习的可测试时间可调奖励模型
机器学习
2026-05-21 v2 计算与语言
摘要
奖励模型是通过强化学习(RL)将语言模型与人类偏好相匹配的核心。随着 RL 越来越多地应用于可验证奖励和多目标对齐等场景,期望奖励模型编码更复杂和多面的偏好分布。然而,分类器奖励模型一旦训练后便保持不变,限制了其在测试时的可调性。我们提出变分原语奖励建模(ICRM),一种新的贝叶斯奖励建模目标,通过在上下文中的偏好演示实现测试可调性。ICRM 将奖励建模建模为在布拉德利-蒂里模型下对潜在偏好概率进行的 amortized 变分推断,采用共轭 Beta 先验。我们展示了 ICRM 能为单目标和多目标场景中的未见偏好分布在测试时进行适应。随着演示次数增加,ICRM 将 RM-Bench 意义准确度从 60.5 提升到 70.8, 在道德困境偏好上实现低于判别器的校准误差,并在冲突偏好下扩展可实现的 Pareto 前沿。我们进一步研究了 ICRM 在 RL 训练中的实际应用,表明它能通过在数学推理中超越常规奖励模型来有效编码可验证奖励。最后,我们提供了该变分目标具有全局内部最优且有限置信度的理论保证,并分析了 KL 正则化如何缓解奖励过度优化。
引用
@article{arxiv.2602.08819,
title = {Bayesian Preference Learning for Test-Time Steerable Reward Models},
author = {Jiwoo Hong and Shao Tang and Zhipeng Wang},
journal= {arXiv preprint arXiv:2602.08819},
year = {2026}
}
备注
Preprint