中文

PersonaEval:LLM评估器是否足够人类来判断角色扮演?

计算与语言 2025-08-15 v1

摘要

当前角色扮演研究常依赖未经验证的LLM评估范式,这可能无法反映人类对角色忠实度的感知。人类对齐评估的关键前提是角色识别,即根据对话上下文识别谁在说话。我们认为,对角色扮演质量(角色被演绎得多好)的任何有意义的判断,根本上都依赖于首先正确地将言语和行为归属到正确的角色(即识别是谁在说话)。我们提出PersonaEval,首个专门测试LLM评估器能否可靠识别人类角色的基准测试。PersonaEval使用来自小说、剧本和视频记录的 human-authored 对话,挑战模型根据对话上下文确定正确的角色。我们的实验包括人类研究,显示即便是表现最好的LLMs也仅达到约69%的准确率,远低于可靠评估所需的水平。相比之下,人类参与者表现接近天花板,达到90.8%的准确率,突显当前LLM评估器在评估角色扮演场景方面仍不够人类化。为更好地理解这一差距,我们检验了训练时适应性和测试时计算,表明可靠的评估不仅依赖于特定任务的调优,更取决于LLM评估器中强大的、类似人类的推理能力。我们将在https://github.com/maple-zhou/PersonaEval发布此基准测试。

关键词

引用

@article{arxiv.2508.10014,
  title  = {PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?},
  author = {Lingfeng Zhou and Jialing Zhang and Jin Gao and Mohan Jiang and Dequan Wang},
  journal= {arXiv preprint arXiv:2508.10014},
  year   = {2025}
}

备注

Accepted by COLM 2025