从正确性到偏好:个性化智能体强化学习框架
计算与语言
2026-05-25 v1
摘要
智能体强化学习在具有明确成功信号的任务中取得了强劲进展。然而,许多现实世界的智能体应用需要基于用户条件的行为:相同的查询可能需要针对不同用户采用不同的规划策略和工具使用决策。这一设定带来了关键挑战:通用奖励无法捕捉异构的用户偏好,观察到的行为与从众效应纠缠在一起,且扁平的记忆无法支持个性化技能检索。为此,我们提出一个统一的个性化智能体强化学习框架,将个性化嵌入训练时优化中。其核心是个性化锚点奖励解耦策略优化(PARPO),它将通用任务质量奖励与个性化偏好奖励解耦,并使用用户特定的锚点来稳定异构奖励尺度下的学习。我们进一步引入两阶段偏好解耦奖励模型和偏好对齐技能演化图记忆(PSGM),用于个性化监督和偏好对齐的技能检索。它们共同构成了偏好识别、策略优化和结构化技能积累的闭环。在ETAPP、ETAPP-Hard和SJAgent上的实验表明,我们的框架持续优于强大的记忆和强化学习基线。代码和数据包含在补充材料中。
引用
@article{arxiv.2605.23382,
title = {From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning},
author = {Ranxu zhang and zeyang li and Jiacheng Huang and Rui Zhang and Xiaozhou Xu and sun zhe and Yanyong Zhang and Chao Wang},
journal= {arXiv preprint arXiv:2605.23382},
year = {2026}
}
备注
34 pages, 7 figures, Under Review