中文

SimulatorArena:用户模拟器是否是 AI 助手多轮评估的可靠代理?

计算与语言 2025-10-10 v2

摘要

大型语言模型(LLM)越来越多地用于交互式应用,人类评估仍是评估其在多轮对话中性能的金标准。由于人类研究成本高昂、耗时且难以复现,最近的研究探索使用 LLM 来模拟用户,以实现助手的自动评估。然而,目前尚无基准或系统性研究来评估这些模拟用户是否可靠地替代真实用户。为此,我们引入了 SimulatorArena,这是一个包含 909 条标注的人类-LLM 对话基准,涵盖数学辅导和文档创建两个交互任务。SimulatorArena 根据模拟器信息与人类行为的接近程度以及助手评级是否与人类判断一致来评估模拟器。在各种模拟器方法上进行实验,显示出于用户轮廓条件化的模拟器(捕获背景和消息风格等特征)与人类判断高度一致。它们在两个任务上达到 Spearman's ρ\rho 为 0.7,为人类评估提供了实用且可扩展的替代方案。使用最佳模拟器对 18 个助手进行基准测试,包括最新的 GPT-5、Claude 4.1 Opus 和 Gemini 2.5 Pro。

关键词

引用

@article{arxiv.2510.05444,
  title  = {SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?},
  author = {Yao Dou and Michel Galley and Baolin Peng and Chris Kedzie and Weixin Cai and Alan Ritter and Chris Quirk and Wei Xu and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2510.05444},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Main