中文

P-Check:通过学习生成动态检查清单来提升个性化奖励模型

计算与语言 2026-04-21 v2

摘要

近期的个性化奖励建模方法主要致力于利用用户交互历史,将模型判断与个人偏好对齐。然而,现有方法大多将用户上下文视为静态或隐式的条件信号,未能捕捉人类判断的动态多维特性。本文提出了 P-Check,一种新的个性化奖励建模框架,旨在训练一个即插即用的检查清单生成器,以合成用于指导奖励预测的动态评估准则。为更好地将这些检查清单与个性化细微差别对齐,我们引入了偏好对比准则加权(Preference-Contrastive Criterion Weighting)训练策略,基于其对个性化判断的判别能力为准则分配显著性分数。我们进行了大量实验,表明 P-Check 不仅提升了奖励准确性,还增强了下游个性化生成能力,并在零样本情境下保持稳健性。

关键词

引用

@article{arxiv.2601.02986,
  title  = {P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist},
  author = {Kwangwook Seo and Dongha Lee},
  journal= {arXiv preprint arXiv:2601.02986},
  year   = {2026}
}

备注

ACL 2026 Main