训练具有主动性和个性化的大语言模型代理
人工智能
2025-11-05 v1 计算与语言
机器学习
摘要
虽然现有工作主要关注任务成功,但我们认为有效的实际应用代理需要优化三个维度:生产力(任务完成)、主动性(询问关键问题)和个性化(适应多样化用户偏好)。我们引入 UserVille,一个包含基于大语言模型的用户模拟器的交互式环境,支持多样化、可配置的用户偏好。利用 UserVille,我们提出了 PPP 方法,这是一种多目标强化学习方法,联合优化这三个维度:生产力、主动性和个性化。在软件工程和深度研究任务上的实验表明,使用 PPP 训练的代理相对于强大基线(如 GPT-5,平均提升 21.6%)实现了显著改进,展示了能够提出战略性澄清性问题、适应未遇到的用户偏好,并通过更好的交互提高任务成功率的能力。这一工作表明,针对用户中心交互进行显式优化对于构建实用且有效的 AI 代理至关重要。
引用
@article{arxiv.2511.02208,
title = {Training Proactive and Personalized LLM Agents},
author = {Weiwei Sun and Xuhui Zhou and Weihua Du and Xingyao Wang and Sean Welleck and Graham Neubig and Maarten Sap and Yiming Yang},
journal= {arXiv preprint arXiv:2511.02208},
year = {2025}
}