重思角色扮演评估:匿名基准测试与人格效应系统性研究
计算与语言
2026-03-05 v1 人工智能
摘要
大型语言模型 (LLM) 已在开发角色扮演代理 (RPA) 中展现出显著潜力。然而,当前研究主要使用著名虚构人物进行评估,使模型能够依赖人物名称相关的记忆。这一依赖关系导致偏差,限制了 RPA 对未见人格的泛化能力。为此,我们提出一种匿名评估方法。跨多个基准的实验结果表明,匿名化显著降低角色扮演性能,确认名称暴露携带隐式信息。此外,我们研究了人格增强以提高匿名设置下的角色忠实度。我们系统比较了源自人类标注的人格特征与模型自生成人格特征的效果。我们的结果表明,纳入人格信息始终能提高 RPA 性能。关键的是,自生成的人格实现了与人类标注相当的性能。这项工作建立了一个更公平的评估协议,并验证了一个可扩展、以人格为增强的框架,用于构建健壮的 RPA。
引用
@article{arxiv.2603.03915,
title = {Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects},
author = {Ji-Lun Peng and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2603.03915},
year = {2026}
}