中文

合成用户、真实差异:面向多轮对话的用户模拟评估框架

计算与语言 2026-05-05 v1

摘要

越来越多地关注通过用户模拟来替代收集和评分真实用户与聊天机器人交互的评估问题。为此,需要确保模拟的真实性,即模拟对话多大程度上反映真实用户与聊天机器人交互的情形。大多数现有方法评估模拟的真实性仅产生粗糙的质量信号,仅停留在单个对话层面。为支持更严格的评估,我们提出 realsim 框架,使实践者能够沿着 8 个维度从分布式角度评估真实对话与模拟对话,涵盖与交互沟通功能、用户状态以及用户消息表面形式相关的属性。我们随后以 1K 组覆盖 16 个聊天机器人应用领域的多轮任务导向真实用户-聊天机器人对话构建了精选数据集。总体而言,我们发现模拟用户在捕捉真实用户引入的沟通摩擦方面存在困难,这可能使得基于此类模拟的评估过于乐观。我们还观察到不同领域性能存在差异,这可能表明需要针对不同领域设计特定的用户模拟器。

关键词

引用

@article{arxiv.2605.02624,
  title  = {Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations},
  author = {Yu Lu Liu and Hyokun Yun and Tanya Roosta and Ziang Xiao},
  journal= {arXiv preprint arXiv:2605.02624},
  year   = {2026}
}