中文

DialSim: 用于评估对话智能体长期多方对话理解的对话模拟器

计算与语言 2025-09-29 v6 人工智能

摘要

大型语言模型的最新进展显著增强了对话智能体,使其可应用于教育、娱乐等多个领域。尽管取得了进展,但对这些智能体的评估常常忽视了真实世界对话的复杂性,例如多方对话和扩展的上下文依赖。为弥补这一差距,我们引入了 DialSim,一个基于对话模拟的评估框架。在 DialSim 中,智能体扮演脚本对话中的一个角色,并基于其仅使用对话历史回答自发问题的能力进行评估,同时识别何时缺乏足够信息。为支持该框架,我们引入了 LongDialQA,一个从长篇电视剧构建的新问答数据集,包含超过 1300 个对话片段,每个片段配以超过 1000 个精心策划的问题,总计超过 352,000 个词元。为最小化对先验知识的依赖,所有角色名称均被匿名化或互换。我们使用 DialSim 对基于最先进 LLM 的对话智能体进行评估,结果显示,即使具有大上下文窗口或 RAG 能力的模型,也难以在长期、多方交互中保持准确理解——这凸显了在对话式 AI 中需要更真实、更具挑战性的基准测试。

关键词

引用

@article{arxiv.2406.13144,
  title  = {DialSim: A Dialogue Simulator for Evaluating Long-Term Multi-Party Dialogue Understanding of Conversational Agents},
  author = {Jiho Kim and Woosog Chay and Hyeonji Hwang and Daeun Kyung and Hyunseung Chung and Eunbyeol Cho and Yeonsu Kwon and Yohan Jo and Edward Choi},
  journal= {arXiv preprint arXiv:2406.13144},
  year   = {2025}
}