中文

不确定性感知奖励模型:教会奖励模型认识未知之物

机器学习 2025-02-13 v2

摘要

奖励模型(RM)是对齐大型语言模型(LLM)与人类期望的关键组件。然而,现有的 RM 难以捕捉人类偏好呈现的随机性和不确定性,无法评估奖励预测的可靠性。为此,我们提出不确定性感知奖励模型(URM)及其集合变体 URME。URM 采用概率价值头,通过建模解耦的人类偏好属性分布来捕捉 aleatoric 不确定性。URME 进一步通过检视集合中各个 URM 之间的差异,以量化 epistemic 不确定性,从而实现不可靠评估的识别。我们的实证评估表明,URM 在 RewardBench 上取得优异成绩,超越了竞争性大型模型。此外,包括最佳-抽样(BoN)、迭代直接偏好优化(iterative DPO)和近端策略优化(PPO)等大量实验表明,URM 和 URME 显著提升了 LLM 的生成质量。值得注意的是,具有较低不确定性的奖励预测更可靠,表现出显著更高的质量,并在对齐方面取得显著性改进。

关键词

引用

@article{arxiv.2410.00847,
  title  = {Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown},
  author = {Xingzhou Lou and Dong Yan and Wei Shen and Yuzi Yan and Jian Xie and Junge Zhang},
  journal= {arXiv preprint arXiv:2410.00847},
  year   = {2025}
}