学习 RLHF 中的悲观奖励模型
机器学习
2025-05-28 v1
摘要
本工作提出了 `PET'(Pessimistic Reward Training,悲观奖励训练),一种新的悲观奖励微调方法,用于在离线强化学习的人类反馈(RLHF)中学习抗住奖励破坏的悲观奖励模型。传统的 RLHF 奖励建模技术训练得到的奖励模型并非完美,KL 正则化在优化策略时发挥着关键作用,以缓解奖励破坏。这种基于直觉的方法仍然存在奖励破坏问题,且在学习过程中排除与数据分布差异较大的策略。在 contrast,我们展示了在通过 PET 微调的悲观奖励模型上优化策略时,无需依赖任何正则化即可防止奖励破坏。我们在标准的 TL;DR 总结数据集上测试了该方法。我们发现,在不使用任何正则化的情况下,仍可学习到高质量的策略。该策略与数据分布的 KL 散度较大,但在实际应用中表现出色。总之,我们的工作表明,学习抗住奖励破坏的悲观奖励模型是可行的。智能体可以基于高悲观奖励的策略进行贪心搜索,而无需担心奖励破坏。
引用
@article{arxiv.2505.20556,
title = {Learning a Pessimistic Reward Model in RLHF},
author = {Yinglun Xu and Hangoo Kang and Tarun Suresh and Yuxuan Wan and Gagandeep Singh},
journal= {arXiv preprint arXiv:2505.20556},
year = {2025}
}