AutoRule:从偏好反馈中提取推理链-of-thought 的规则基准奖励以改进偏好学习
机器学习
2025-06-19 v1 人工智能
计算与语言
摘要
规则基准奖励是改进强化学习人类反馈(RLHF)的有前景策略,但当前方法常依赖手动规则工程。我们提出 AutoRule,一种从偏好反馈中自动提取规则并构建规则基准奖励的方法。AutoRule 提取过程分为三个阶段:它利用推理模型解释用户偏好,从这些解释的推理链中识别候选规则,并将其综合为统一的规则集合。借助最终确定的规则集合,我们使用语言模型验证器计算每个输出满足规则的比例,将其作为辅助奖励,与学习到的奖励模型一起用于策略优化。在使用 AutoRule 训练 Llama-3-8B 模型后,在 AlpacaEval2.0 上长度控制获胜率实现 28.6% 的相对提升,在保密的 MT-Bench 子集上第二轮表现提升 6.1%,相较于仅使用相同学习奖励模型但不采用规则基准辅助奖励的 GRPO 基线显著优于。我们的分析确认,提取的规则与数据集偏好具有良好一致性。我们发现 AutoRule 在两个回合中相较于学习奖励模型表现出更少的奖励攻击。最后,我们的案例研究表明,提取的规则捕捉了不同数据集中所值得的独特质量。提取的规则列于附录,代码已开源于 https://github.com/cxcscmu/AutoRule。
关键词
引用
@article{arxiv.2506.15651,
title = {AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning},
author = {Tevin Wang and Chenyan Xiong},
journal= {arXiv preprint arXiv:2506.15651},
year = {2025}
}