从人类反馈中学习个性化智能体
人工智能
2026-02-19 v1 计算与语言
机器学习
摘要
现代人工智能智能体功能强大,但往往无法与 individual 用户的独特性、不断变化的偏好相匹配。以往的方法通常依赖静态数据集,要么在交互历史上训练隐式偏好模型,要么在外部记忆中编码用户轮廓。然而,这些方法在处理新用户以及随时间变化的偏好方面存在困难。我们提出了从人类反馈中学习个性化智能体 (PAHF),这是一种持续个性化框架,智能体可通过显式的 per-user 记忆在线学习。PAHF 实现了一个三步循环:(1) 为消除歧义而寻求事前确认,(2) 从记忆中检索偏好来 grounding 动作,(3) 在偏好漂移时整合事后反馈以更新记忆。为评估这一能力,我们开发了一个四阶段协议和两个基准测试,分别针对具身操控和在线购物。这些基准测试量化了智能体从零开始学习初始偏好以及随后适应人格变化的能力。我们的理论分析和实证结果表明,集成显式记忆与双反馈通道至关重要:PAHF 学习速度显著更快, consistently 优于无记忆和单通道基线,显著减少初始个性化误差,并实现对偏好变化的快速适应。
引用
@article{arxiv.2602.16173,
title = {Learning Personalized Agents from Human Feedback},
author = {Kaiqu Liang and Julia Kruk and Shengyi Qian and Xianjun Yang and Shengjie Bi and Yuanshun Yao and Shaoliang Nie and Mingyang Zhang and Lijuan Liu and Jaime Fernández Fisac and Shuyan Zhou and Saghar Hosseini},
journal= {arXiv preprint arXiv:2602.16173},
year = {2026}
}