中文

基于一阶逻辑的RLHF奖励模型替代方案

机器学习 2025-12-17 v1 计算机科学中的逻辑

摘要

从人类反馈中进行强化学习(RLHF)在与大型语言模型(LLM)对齐人类价值和偏好方面发挥着关键作用。然而,训练得到的奖励模型的质量和稳定性直接决定最终的对齐性能。现有方法如近端策略优化(PPO)高度依赖奖励模型来引导LLM趋向人类对齐的行为。本文提出一种基于逻辑相似性的奖励机制,作为常规奖励建模的替代方案。我们的方法不依赖启发式奖励估计,而是利用形式逻辑一致性来引导模型与人类偏好相匹配。由于现实世界的问题可以从多个角度进行解释,为确保基于逻辑的强化学习不会导致模型崩溃,我们引入S-GRPO,即GRPO框架的监督变体。S-GRPO包含额外的监督成分,联合优化生成项、KL散度正则化和基于标签的目标。在实验中,我们的结果表明,S-GRPO在性能和鲁棒性方面 consistently 优于标准的监督微调(SFT)。此外,它扩展了现有的偏好学习框架,如GRPO和DPO,提供了一种更灵活和任务适应的方法进行对齐训练。我们的代码可在https://github.com/ChunjinJiang/sgrpo获取。

关键词

引用

@article{arxiv.2512.14100,
  title  = {A First-Order Logic-Based Alternative to Reward Models in RLHF},
  author = {Chunjin Jian and Xinhua Zhu},
  journal= {arXiv preprint arXiv:2512.14100},
  year   = {2025}
}