中文

UserRL:通过强化学习训练交互式以用户为中心的智能体

人工智能 2025-09-25 v1 计算与语言 机器学习

摘要

强化学习(RL)已展现出在训练智能体模型方面的潜力,使其超越静态基准并参与动态的多轮交互。然而,这类智能体的最终价值在于它们辅助用户的能力,而用户交互的多样性和动态性带来了挑战。在这项工作中,我们提出了 UserRL,一个通过标准化 gym 环境与模拟用户配对来训练和评估以用户为中心能力的统一框架。我们系统地变化了回合级奖励分配和轨迹级评分计算,以分析不同公式如何影响基于 GRPO 算法的学习。我们在 Qwen3 模型上的实验揭示了三个关键发现:(i)SFT 冷启动对于解锁初始交互能力和实现持续的 RL 改进至关重要;(ii)刻意设计的轨迹评分能产生更高效和有效的多轮交互;(iii)虽然更强的模拟用户(如 GPT-4o)有助于训练,但开源模拟器(如 Qwen3-32B)仍然是一种经济高效且可迁移的选择。这些结果共同表明,奖励塑形和用户模拟选择的精心设计与模型规模同等重要,并将 UserRL 确立为开发鲁棒的以用户为中心的智能体模型的实用途径。所有代码和数据都是公开的,供未来研究使用。

关键词

引用

@article{arxiv.2509.19736,
  title  = {UserRL: Training Interactive User-Centric Agent via Reinforcement Learning},
  author = {Cheng Qian and Zuxin Liu and Akshara Prabhakar and Jielin Qiu and Zhiwei Liu and Haolin Chen and Shirley Kokane and Heng Ji and Weiran Yao and Shelby Heinecke and Silvio Savarese and Caiming Xiong and Huan Wang},
  journal= {arXiv preprint arXiv:2509.19736},
  year   = {2025}
}

备注

28 Pages, 15 Figures, 6 Tables; Built upon latest UserBench release: arXiv:2507.22034