学习总结用户信息以实现个性化的人类反馈强化学习
机器学习
2026-02-06 v3 人工智能
摘要
随着大语言模型(LLM)AI 助手日常用例的不断扩展,针对不同用户的偏好与目标对响应进行个性化变得日益重要。虽然人类反馈强化学习(RLHF)在提升 LLM 的整体有用性与流畅性方面效果显著,但它并未考虑用户间的差异性,因为它使用单一奖励模型对整个用户群体建模,即假设所有人的偏好都相同。我们提出了一种新颖的框架——基于摘要的偏好学习(PLUS),它利用强化学习(RL)学会为每位用户生成基于文本的偏好、特征与历史对话摘要。这些摘要作为奖励模型的条件,使其能够针对每位用户所重视的响应类型做出个性化预测。用户摘要模型与奖励模型同时训练,形成在线协同适应循环。我们表明,与标准的 Bradley-Terry 模型相比,PLUS 生成的摘要能够捕捉用户偏好的多个方面,使奖励模型准确率获得 11–77% 的提升。PLUS 的主要优势包括:(1) 在面对新用户与新对话主题时具有稳健的性能,相较于用于 RLHF 的最佳个性化奖励模型技术提升 25%;(2) 与 GPT-4 等最先进的专有模型实现零样本个性化(例如,以 PLUS 摘要为条件的响应相比默认 GPT-4o 取得 72% 的胜率,而后者为 28%);(3) 可从偏好标签之外的灵活用户上下文中进行学习;(4) 提供可解释的用户表征,从而在多元 LLM 对齐中实现更高的透明度与用户可控性。
引用
@article{arxiv.2507.13579,
title = {Learning to summarize user information for personalized reinforcement learning from human feedback},
author = {Hyunji Nam and Yanming Wan and Mickel Liu and Peter Ahnn and Jianxun Lian and Natasha Jaques},
journal= {arXiv preprint arXiv:2507.13579},
year = {2026}
}
备注
10 pages for main text, 10 pages for appendix