FURINA:基于可扩展多智能体协作管线的全方位可定制角色扮演基准
计算与语言
2026-04-07 v3 人工智能
人机交互
多智能体系统
摘要
随着大型语言模型(LLM)在角色扮演(RP)任务中的进步,现有基准因范围狭窄、交互范式过时以及在多样化应用场景中适应性有限而迅速过时。为填补这一空白,我们引入了 FURINA-Builder,这是一个 novel 的多智能体协作管线,能够自动构建任意规模的全方位可定制角色扮演基准。它使我们能够对任意角色在多样化情境和提示格式下进行评估,作为 RP 领域首个具有可适应性评估能力的基准构建器。FURINA-Builder 模拟测试角色与从精心构建的角色-场景池中抽取的其他角色之间的对话,而 LLM 仲裁者则挑选细粒度评估维度并调整测试角色的响应,以生成最终测试语句。通过该管线,我们构建了 FURINA-Bench,这是一个新的综合性角色扮演基准,包含既 established 又合成的测试角色,每个角色均根据特定评估维度进行评估。人类评估和初步可分离性分析均证明了我们的管线和基准设计的有效性。我们对前沿 LLM 进行了广泛评估,发现 o3 和 DeepSeek-R1 在英语和中文 RP 任务中表现最佳。在所有模型中,established 角色始终优于合成角色,推理能力进一步放大了这一差距。有趣的是,我们发现模型规模并不单调降低幻觉现象。更关键的是,对于推理 LLM,我们发现了一种新型权衡:推理改善了 RP 性能,但同时也增加了 RP 幻觉。这种权衡在所有 LLM 的 RP 性能与可靠性之间扩展为更广泛的 Pareto 前沿。这些发现表明 FURINA-Builder 的有效性以及 FURINA-Bench 所带来的挑战。
引用
@article{arxiv.2510.06800,
title = {FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline},
author = {Haotian Wu and Shufan Jiang and Chios Chen and Yiyang Feng and Hehai Lin and Heqing Zou and Yao Shu and Chengwei Qin},
journal= {arXiv preprint arXiv:2510.06800},
year = {2026}
}