PersonaArena:用于评估和提升大型语言模型人物级角色扮演的动态仿真框架
人工智能
2026-05-19 v1
摘要
大型语言模型 (LLMs) 越来越多地作为交互式社交代理运作,但其在保持连贯和真实的人物级角色扮演能力仍受限,尤其是在真实的社交情境中。现有研究主要聚焦于角色层级设置,依赖静态评估格式,无法捕捉日常社交互动的复杂性。本文提出 PersonaArena,一个用于评估和提升 LLMs 人物级角色扮演的动态仿真框架。PersonaArena 利用大规模筛选后的用户生成社交内容构建细腻的人物银行,托演多轮、情境丰富的互动。我们的框架具备多代理辩论评委,用于整体且无偏见的评估。通过大量实验,我们证明 PersonaArena 能够对 LLMs 的角色扮演能力进行严格评估和提升,推动开发更具真实性和社交熟练的 AI 代理。
引用
@article{arxiv.2605.17044,
title = {PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models},
author = {Wenlong Shi and Jianxun Lian and Mingqi Wu and Haiming Qin and Mingyang Zhou and Xing Xie and Naipeng Chao and Hao Liao},
journal= {arXiv preprint arXiv:2605.17044},
year = {2026}
}
备注
ACL 2026 Findings