中文

CharacterEval:面向角色扮演对话智能体评估的中文基准

计算与语言 2024-01-10 v2

摘要

近期,大型语言模型(LLMs)的出现彻底改变了生成式智能体。其中,角色扮演对话智能体(RPCAs)因其能够与用户进行情感互动而备受关注。然而,缺乏全面的基准阻碍了该领域的进展。为填补这一空白,我们引入了CharacterEval,一个用于全面评估RPCAs的中文基准,并辅以专门定制的高质量数据集。该数据集包含1,785个多轮角色扮演对话,涵盖23,020个示例,并包含来自中国小说和剧本的77个角色。数据集经过精心构建,首先通过GPT-4进行初始对话提取,然后进行严格的人工质量控制,并利用百度百科的深度角色资料进行增强。CharacterEval采用多层面评估方法,涵盖四个维度上的十三个针对性指标。在CharacterEval上的全面实验表明,中文LLMs在中文角色扮演对话中展现出比GPT-4更有前景的能力。源代码、数据源和奖励模型将在https://github.com/morecry/CharacterEval公开。

关键词

引用

@article{arxiv.2401.01275,
  title  = {CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation},
  author = {Quan Tu and Shilong Fan and Zihang Tian and Rui Yan},
  journal= {arXiv preprint arXiv:2401.01275},
  year   = {2024}
}