BotChat:评估 LLM 的多轮对话能力
计算与语言
2023-10-23 v1
摘要
通过高质量多轮对话与人类交互是大型语言模型(LLM)的关键特征。然而,对此类能力基于人工的评估涉及密集的体力劳动。本报告通过一种基于 LLM 的方法,对现有大型语言模型进行类人多轮聊天能力的初步评估。我们从真实世界的人类对话出发,保留其首个话语作为 ChatSEED。随后我们提示 LLM 基于 ChatSEED 逐句生成完整的多轮对话(数十句话语)。最后,我们采用最先进的 LLM(GPT-4 等)作为评判者来评估所生成的对话。在不同的评估协议下,我们得到了高度一致的结论。我们发现 GPT-4 能生成具有令人印象深刻的类人质量的多轮对话,显著优于其他同类模型。判别器难以区分 GPT-4 生成的对话与人类对话。相比之下,其他 LLM 由于指令遵循能力弱、倾向于生成冗长话语或通用能力有限,难以生成满意质量的多轮对话。所有数据与代码将在 https://github.com/open-compass/BotChat/ 提供,我们希望它们能作为评估 LLM 多轮聊天能力的宝贵资源。
引用
@article{arxiv.2310.13650,
title = {BotChat: Evaluating LLMs' Capabilities of Having Multi-Turn Dialogues},
author = {Haodong Duan and Jueqi Wei and Chonghua Wang and Hongwei Liu and Yixiao Fang and Songyang Zhang and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2310.13650},
year = {2023}
}