PaTaRM:通过偏好感知任务自适应奖励建模桥接二元与点信号
机器学习
2026-04-21 v3 人工智能
摘要
奖励模型(RMs)是强化学习从人类反馈(RLHF)中的核心,提供将大型语言模型(LLMs)与人类偏好对齐的关键监督信号。生成式奖励模型(GRMs)比传统标量 RMs 提供更大的可解释性,但带来一个关键权衡:两元方法因 training-inference mismatch 受限,而点方法需要高成本的绝对标注。为桥接这一差距,我们提出偏好感知任务自适应奖励模型(PaTaRM)。不同于先前方法,PaTaRM通过一种新颖的偏好感知奖励(PAR)机制,使可利用现有的两元数据进行稳健的点训练,无需显式的评分标签。此外,它包含任务自适应评选系统,可动态生成 instance-specific 标准以实现精确评估。广泛的实验表明,PaTaRM 在 RewardBench 和 RMBench 上的 Qwen3-8B/14B 模型上实现约8.7%的平均准确率提升。关键的是,它在 IFEval 和 InFoBench 上的下游 RLHF 性能提升了平均约13.6%的相对提升,验证了其对政策对齐的有效性。我们的代码可在https://github.com/JaneEyre0530/PaTaRM 上获取。
关键词
引用
@article{arxiv.2510.24235,
title = {PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling},
author = {Ai Jian and Jingqing Ruan and Xing Ma and Xiaoyun Zhang and Dailin Li and Weipeng Zhang and Ke Zeng and Xunliang Cai},
journal= {arXiv preprint arXiv:2510.24235},
year = {2026}
}
备注
ACL Main