中文

P-GenRM:具有测试时用户基缩放功能的个性化生成式奖励模型

计算与语言 2026-02-13 v1

摘要

大型语言模型的个性化对齐旨在使响应适应个体用户偏好,通常通过强化学习实现。一个关键挑战是在开放式场景中获得准确、特定于用户的奖励信号。现有的个性化奖励模型面临两个持续存在的局限性:(1) 将多样化的、特定场景的偏好过度简化为一个小的、固定的评估原则集;(2) 难以泛化到反馈有限的新用户。为此,我们提出了P-GenRM,这是首个具有测试时用户基缩放功能的个性化生成式奖励模型。P-GenRM将偏好信号转化为结构化的评估链,这些评估链在各种场景中推导出自适应的角色和评分标准。它进一步将用户聚类为用户原型,并引入了一种双粒度缩放机制:在个体层面,它自适应地缩放和聚合每个用户的评分方案;在原型层面,它整合了相似用户的偏好。这种设计减轻了推断偏好中的噪声,并通过基于原型的迁移增强了对未见用户的泛化能力。实验结果表明,P-GenRM在广泛使用的个性化奖励模型基准上达到了最先进的结果,平均提升了2.31%,并在一个分布外数据集上展示了强大的泛化能力。值得注意的是,测试时用户基缩放提供了额外的3%提升,展示了通过测试时可扩展性实现更强的个性化对齐。

关键词

引用

@article{arxiv.2602.12116,
  title  = {P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling},
  author = {Pinyi Zhang and Ting-En Lin and Yuchuan Wu and Jingyang Chen and Zongqi Wang and Hua Yang and Ze Xu and Fei Huang and Kai Zhang and Yongbin Li},
  journal= {arXiv preprint arXiv:2602.12116},
  year   = {2026}
}

备注

Accepted as ICLR 2026 Oral