超越合作模拟器:为强大的 LLM 代理生成真实用户人格
人工智能
2026-05-14 v1 计算与语言
摘要
大语言模型(LLM)代理正在部署到与各种用户互动的场景中,包括那些不清楚、急躁或不愿意分享信息的用户。然而,规模获取真实互动数据的成本仍然很高。该领域转向 LLM 基于用户模拟器作为替代方案,但这些模拟器继承了其底层模型的行为特征:合作且同质化。结果是,表面上在模拟中表现良好的代理在面对未遇到的、多样化的用户沟通模式时常常失败。为缩小这一差距,我们引入 Persona Policies(PPol),这是一种即插即用的控制层,旨在在用户模拟器中诱导真实的行为变异,同时保持原有的任务目标。我们将人格生成视为一种 LLM 驱动的进化程序搜索,优化 Python 生成器以发现行为并将其转化为保持任务完整性的角色扮演政策。引导候选生成器的多目标适应度评分结合了人类似度与对人类行为模式的广泛覆盖。一旦优化完成,生成器即可为任何领域任务产生多样化的人类式人格。对于 tau^2-bench 中的零售和航空领域,进化后的 PPol 程序相对于基线模拟器实现了 33-62 个百分点的适应度提升。在盲测评估中,注释员将 PPol 条件下的用户评为人类的概率为 80.4%,接近真实人类痕迹,几乎是基线模拟器的两倍。在 PPol 训练的代理对挑战性、超分布行为更具鲁棒性,任务成功率相对于仅使用现有模拟互动进行训练的提升了 +17%。这提供了一种新方法,用于在不改变任务或奖励的情况下强化基于模拟器的评估和训练。
引用
@article{arxiv.2605.12894,
title = {Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents},
author = {Harshita Chopra and Kshitish Ghate and Aylin Caliskan and Tadayoshi Kohno and Chirag Shah and Natasha Jaques},
journal= {arXiv preprint arXiv:2605.12894},
year = {2026}
}
备注
Preprint under review