中文

CharacterBox:评估文本虚拟世界中LLM角色扮演能力的框架

计算与语言 2024-12-10 v1 人工智能

摘要

角色扮演是大型语言模型(LLM)的一项关键能力,能够支持广泛的应用,包括智能非玩家角色、数字孪生和情感伴侣。由于角色扮演涉及复杂的动态过程,例如在故事情节中保持角色一致性以及在缺乏明确真值的情况下驾驭开放式叙事,因此评估LLM的这一能力具有挑战性。当前主要聚焦于问答或对话快照的评估方法,无法充分捕捉真实角色扮演所必需的角色细微特征与行为。在本文中,我们提出了CharacterBox,这是一个用于生成情境细粒度角色行为轨迹的模拟沙盒。这些行为轨迹能够实现对角色扮演能力更全面、更深入的评估。CharacterBox由两个主要组件构成:角色智能体和叙述者智能体。角色智能体基于心理学与行为科学,展现出类人行为;叙述者智能体则协调角色智能体之间的交互以及环境变化。此外,我们引入两种基于轨迹的方法,利用CharacterBox提升LLM的性能。为降低成本并促进CharacterBox在公共社区中的采用,我们对两个较小的模型进行了微调——CharacterNR和CharacterRM,作为GPT API调用的替代方案,并展示了它们与先进GPT API相比具有竞争力的性能。

关键词

引用

@article{arxiv.2412.05631,
  title  = {CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds},
  author = {Lei Wang and Jianxun Lian and Yi Huang and Yanqi Dai and Haoxuan Li and Xu Chen and Xing Xie and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2412.05631},
  year   = {2024}
}