PIRA: 面向偏好导向的指令调优奖励模型
计算与语言
2026-02-03 v2
摘要
奖励模型是实现大型语言模型(LLM)与人类偏好对齐的关键技术。现有方法存在两个主要局限性:判别式奖励模型需要大规模标注数据,因为无法利用可供生成式奖励模型使用的偏好指令遵循能力;此外,奖励模型特别容易出现奖励过优化,即LLM会利用奖励函数中的弱点而非改进真实对齐。我们提出\textbf{PIRA},一种将三种互补策略集成到训练范式中的方法,以解决上述挑战:(1)将问答对重新格式化为偏好任务指令,以显式利用LLM的偏好指令遵循能力;(2)对每个样本来自多种偏好任务指令的奖励进行平均聚合,以缓解任务特定偏差并提高跨评估视角的鲁棒性;(3)对不同dropout率下值头的输出进行平均,以稳定奖励估计。在公开数据集上的实验表明,PIRA在性能上有显著提升,增强了泛化能力,并有效缓解了奖励过优化问题。
引用
@article{arxiv.2511.20668,
title = {PIRA: Preference-Oriented Instruction-Tuned Reward Models with Dual Aggregation},
author = {Yongfu Xue},
journal= {arXiv preprint arXiv:2511.20668},
year = {2026}
}
备注
Accepted to EACL 2026