SocialBench:角色扮演会话智能体的社交性评估
计算与语言
2024-08-06 v4
摘要
大型语言模型(LLMs)推动了各种 AI 会话智能体的发展,包括模仿多样角色和人类行为的角色扮演会话智能体。虽然先前的研究主要集中在增强这些智能体的会话能力、特定角色知识和风格属性上,但在评估其社交智能方面存在明显空白。在本文中,我们介绍了 SocialBench,这是第一个旨在系统评估角色扮演会话智能体在个体和群体社交互动层面社交性的基准。该基准由多种来源构建,涵盖 500 个角色、超过 6,000 个问题提示和 30,800 轮多轮角色扮演话语。我们使用主流的开源和闭源 LLMs 在该基准上进行了全面评估。我们发现,智能体在个体层面的优异表现并不意味着其在群体层面的熟练。此外,个体的行为可能会因群体内其他智能体施加的影响而发生漂移。在 SocialBench 上的实验结果证实了其作为评估角色扮演会话智能体社交互动测试平台的重要性。该基准可在 https://github.com/X-PLUG/SocialBench 公开获取。
引用
@article{arxiv.2403.13679,
title = {SocialBench: Sociality Evaluation of Role-Playing Conversational Agents},
author = {Hongzhan Chen and Hehong Chen and Ming Yan and Wenshen Xu and Xing Gao and Weizhou Shen and Xiaojun Quan and Chenliang Li and Ji Zhang and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2403.13679},
year = {2024}
}
备注
ACL 2024 Findings