中文

RewardAnything:通用可泛化的原则遵循奖励模型

计算与语言 2025-07-08 v2 人工智能 机器学习

摘要

奖励模型(Reward Models)对于引导大语言模型优化至关重要,通常在固定偏好数据集上训练,导致对单一、隐式偏好分布的刚性对齐。这阻止了适应多样化的真实需求——从某项任务中的简洁性到另一项任务中的详细解释。收集任务特定偏好数据并重新训练奖励模型的标准做法资源密集,往往产生有偏的奖励,并限制了实际应用。我们引入了通用可泛化的原则遵循奖励模型。我们提出奖励模型应理解并遵守动态提供的自然语言奖励原则规范,类似于LLM中的指令遵循能力。为了衡量这种能力,我们开发了RABench,一个专注于跨多样化原则泛化的奖励模型综合基准。在RABench上的评估揭示了当前奖励模型的泛化能力较差。作为解决方案,我们提出了RewardAnything,一个专门设计并训练用于明确遵循自然语言原则的新型奖励模型。我们在传统奖励模型基准上通过指定一个定义良好的原则,以RewardAnything取得了SotA性能,RABench上的结果表明我们在不重新训练的情况下擅长适应新原则。此外,RewardAnything与现有RLHF方法无缝集成,我们通过一个案例研究展示了如何仅使用自然语言原则自动高效地对齐LLM。

关键词

引用

@article{arxiv.2506.03637,
  title  = {RewardAnything: Generalizable Principle-Following Reward Models},
  author = {Zhuohao Yu and Jiali Zeng and Weizheng Gu and Yidong Wang and Jindong Wang and Fandong Meng and Jie Zhou and Yue Zhang and Shikun Zhang and Wei Ye},
  journal= {arXiv preprint arXiv:2506.03637},
  year   = {2025}
}

备注

25 pages, 9 figures, Code & model weights available at: https://zhuohaoyu.github.io/RewardAnything