大型语言模型的角色扮演评估
计算与语言
2025-05-20 v1 人工智能
摘要
大型语言模型(LLM)展示出显著的能力,可采纳角色并进行角色扮演。然而,对这种能力的评估 presents 诸多挑战,因为人类评估资源密集,自动化评估可能偏差。为此,我们引入 Role-Playing Eval(RPEval),一个新颖的基准,用于评估 LLM 在角色扮演能力上涵盖四个关键维度:情感理解、决策、道德对齐和角色一致性。本文详细介绍了 RPEval 的构建过程并呈现了基线评估结果。我们的代码和数据集已公开于 https://github.com/yelboudouri/RPEval。
引用
@article{arxiv.2505.13157,
title = {Role-Playing Evaluation for Large Language Models},
author = {Yassine El Boudouri and Walter Nuninger and Julian Alvarez and Yvan Peter},
journal= {arXiv preprint arXiv:2505.13157},
year = {2025}
}