ProactiveEval:面向主动式对话代理的统一评估框架
计算与语言
2025-08-29 v1 人工智能
人机交互
摘要
主动式对话作为推进大型语言模型(LLMs)的关键且具挑战性的研究问题日益受到关注。现有工作主要聚焦于特定领域或任务导向场景,导致评估碎片化,限制了对模型主动式对话能力的全面探索。本文提出了 ProactiveEval,一个统一的框架,用于评估 LLMs 的主动式对话能力。该框架将主动式对话分解为目标规划与对话引导,在 various 领域建立评估指标。此外,该框架还能够自动生成多样且具挑战性的评估数据。基于所提出的框架,我们开发了328个评估环境,涵盖6个不同领域。通过对22种不同类型的 LLMs 进行实验,表明 DeepSeek-R1 和 Claude-3.7-Sonnet 在目标规划和对话引导任务方面表现突出。最后,我们探讨了推理能力如何影响主动式行为,并讨论了其对未来模型开发的意义。
引用
@article{arxiv.2508.20973,
title = {ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents},
author = {Tianjian Liu and Fanqi Wan and Jiajian Guo and Xiaojun Quan},
journal= {arXiv preprint arXiv:2508.20973},
year = {2025}
}
备注
21 pages, 6 Figures