中文

LLM 代理能否模拟多轮人类行为?来自真实在线客服行为数据的证据

计算与语言 2026-04-30 v8

摘要

最近的研究表明,LLM 代理可以通过仅靠提示方法生成“可信”的人类行为,而此类代理正被越来越多地应用于下游应用。然而,现有对这些代理的评估仅关注定性可信度(人类评估者是否认为其准确),留下了LLM代理在多轮交互任务中是否能准确生成模仿特定人类行为的逐步动作这一问题。本文以购物车为案例,首次对最先进的LLMs进行大规模定量评估。我们使用来自 31,865 场在线购物场景中包含 230,965 条用户动作的真实世界数据进行评估,结果显示,基于提示的LLMs(DeepSeek-R1、Llama、Claude)在生成人类动作方面仅达到 11.86% 的准确率,凸显了实际行为准确性的显著差距。通过实验,我们还展示,仅仅通过对真实人类点击-through 数据进行微调并辅以合成推理痕迹,就能显著提升模型性能。经微调的 Qwen2.5-7B 在动作生成准确率和最终购买预测 F1 分数上分别提升了 5.4% 和 13.85%,超越了基于提示的基线。这一工作建立了第一个严格的基准,为开发更精确的LLM代理提供了可操作的见解,以适应未来下游应用。

关键词

引用

@article{arxiv.2503.20749,
  title  = {Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data},
  author = {Yuxuan Lu and Jing Huang and Yan Han and Bingsheng Yao and Sisong Bei and Jiri Gesi and Yaochen Xie and Yisi Sang and Zheshen and Wang and Qi He and Dakuo Wang},
  journal= {arXiv preprint arXiv:2503.20749},
  year   = {2026}
}