Act-Adaptive Margin:针对主观模糊性的奖励模型动态校准
计算与语言
2026-01-09 v2 人工智能
摘要
目前,大多数强化学习任务集中在数学和编程等领域,这些领域的验证相对简单。然而,在角色扮演等主观任务中,对齐技术难以取得进展,主要是因为使用Bradley-Terry模型的主观奖励建模在处理模糊偏好时面临重大挑战。为了改进主观任务中的奖励建模,本文提出了AAM(\textbf{\underline{A}}ct-\textbf{\underline{A}}daptive \textbf{\underline{M}}argin),该方法通过使用模型的内部参数知识动态校准偏好裕度来增强奖励建模。我们设计了两个版本的AAM,无需额外的人工标注即可高效生成符合上下文的偏好差距。该方法通过更好地将生成式理解与偏好评分相结合,从根本上改进了奖励模型处理主观奖励的方式。为了验证AAM在主观奖励建模中的有效性,我们在RewardBench、JudgeBench和具有挑战性的角色扮演任务上进行了评估。结果表明,AAM显著提高了主观奖励建模性能,在通用任务中将Bradley-Terry奖励模型提升了2.95\%,在主观角色扮演任务中提升了4.85\%。此外,使用AAM训练的奖励模型可以帮助下游对齐任务取得更好的结果。我们的测试结果表明,将AAM增强的RM生成的奖励应用于偏好学习技术(例如GRPO),在CharacterEval和Charm上取得了SOTA结果。代码和数据集可在 https://github.com/calubkk/AAM 获取。
关键词
引用
@article{arxiv.2505.23923,
title = {Act-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective Ambiguity},
author = {Feiteng Fang and Dingwei Chen and Xiang Huang and Ting-En Lin and Yuchuan Wu and Xiong Liu and Xinge Ye and Ziqiang Liu and Haonan Zhang and Liang Zhu and Hamid Alinejad-Rokny and Min Yang and Yongbin Li},
journal= {arXiv preprint arXiv:2505.23923},
year = {2026}
}