中文

CharacterBench: 大语言模型角色定制能力的基准测试

计算与语言 2024-12-17 v1

摘要

基于角色的对话(即角色扮演)允许用户自由定制角色进行交互,这通常依赖于大语言模型(LLM),因此需要评估LLM的角色定制能力。然而,现有基准测试往往只涉及单一角色类别或评估有限维度,无法确保稳健评估。此外,响应中角色特征的稀疏性使得以特征为中心的生成式评估既低效又无效。为解决这些问题,我们提出了CharacterBench,这是最大的双语生成式基准测试,包含22,859个人工标注样本,涵盖来自25个详细角色类别的3,956个角色。我们定义了6个方面的11个维度,根据特定维度评估的角色特征是否在每个响应中显现,将其分为稀疏维度和密集维度。我们通过为每个维度设计定制查询来诱导角色产生与特定维度相关的响应,从而实现有效且高效的评估。此外,我们开发了CharacterJudge模型,用于成本效益高且稳定的评估。实验表明,它优于SOTA自动评估器(如GPT-4),并且我们的基准测试具有优化LLM角色定制能力的潜力。我们的代码库位于https://github.com/thu-coai/CharacterBench。

关键词

引用

@article{arxiv.2412.11912,
  title  = {CharacterBench: Benchmarking Character Customization of Large Language Models},
  author = {Jinfeng Zhou and Yongkang Huang and Bosi Wen and Guanqun Bi and Yuxuan Chen and Pei Ke and Zhuang Chen and Xiyao Xiao and Libiao Peng and Kuntian Tang and Rongsheng Zhang and Le Zhang and Tangjie Lv and Zhipeng Hu and Hongning Wang and Minlie Huang},
  journal= {arXiv preprint arXiv:2412.11912},
  year   = {2024}
}

备注

AAAI 2025