中文

ProactiveEval:面向主动式对话代理的统一评估框架

计算与语言 2025-08-29 v1 人工智能 人机交互

摘要

主动式对话作为推进大型语言模型(LLMs)的关键且具挑战性的研究问题日益受到关注。现有工作主要聚焦于特定领域或任务导向场景,导致评估碎片化,限制了对模型主动式对话能力的全面探索。本文提出了 ProactiveEval,一个统一的框架,用于评估 LLMs 的主动式对话能力。该框架将主动式对话分解为目标规划与对话引导,在 various 领域建立评估指标。此外,该框架还能够自动生成多样且具挑战性的评估数据。基于所提出的框架,我们开发了328个评估环境,涵盖6个不同领域。通过对22种不同类型的 LLMs 进行实验,表明 DeepSeek-R1 和 Claude-3.7-Sonnet 在目标规划和对话引导任务方面表现突出。最后,我们探讨了推理能力如何影响主动式行为,并讨论了其对未来模型开发的意义。

关键词

引用

@article{arxiv.2508.20973,
  title  = {ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents},
  author = {Tianjian Liu and Fanqi Wan and Jiajian Guo and Xiaojun Quan},
  journal= {arXiv preprint arXiv:2508.20973},
  year   = {2025}
}

备注

21 pages, 6 Figures