中文

评估 LLM 模拟对话中不一致与非协作行为的建模

计算与语言 2026-03-19 v1

摘要

使用大型语言模型(LLM)模拟人类对话已成为一种可扩展的建模人类社交互动的方法。然而,由于人类对话本质上涉及不一致和非协作行为(如误解和插话),模拟人类对话具有挑战性。目前,关于人类与 LLM 生成对话中不一致和非协作行为的分析仍有限,尽管复现这些行为是模拟类人且复杂社交互动的关键。本文引入 CoCoEval,一个评估框架,通过 LLM-as-a-Judge 检测 10 种类型的 turn 级别的不一致和非协作行为来分析 LLM 模拟的对话。使用 CoCoEval,我们评估了 GPT-4.1、GPT-5.1 和 Claude Opus 4,通过比较这些模型在 academic、business 和 governmental 会议以及辩论中模拟的对话中检测到的行为频率与人类对话的差异。我们的分析表明:(1)在 vanilla 提示下,LLM 模拟的对话比人类对话中不一致和非协作行为频率更低;(2)提示工程并未对这些行为提供可靠的控制,因为我们的结果显示不同提示会导致这些行为的欠或过生产;(3)在人类对话上的监督微调可能导致 LLM 过度生产狭窄的某些行为,如重复。我们的结果凸显了模拟人类对话的难度,提出了对将 LLM 用作人类社交互动代理的担忧。

关键词

引用

@article{arxiv.2603.17094,
  title  = {Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction},
  author = {Ryo Kamoi and Ameya Godbole and Longqi Yang and Rui Zhang and Mengting Wan and Pei Zhou},
  journal= {arXiv preprint arXiv:2603.17094},
  year   = {2026}
}