SocialEval:评估大语言模型的社会智能
计算与语言
2025-06-03 v1
摘要
LLM 在建模人类行为方面展现出令人期待的社会智能(Social Intelligence, SI),这引发了对评估 LLM 的 SI 及其与人类差异的需求。SI 赋予人类人际交往能力,使其在处理社会互动以实现社会目标时表现明智。这提出了一种操作性评估范式:面向结果的目标达成评估与面向过程的人际能力评估,而现有工作未能解决此问题。为此,我们提出 SocialEval,一个基于剧本的双语 SI 基准,通过人工构建叙事剧本整合了面向结果与面向过程的评估。每个剧本被构建为一棵世界树,其中包含由人际能力驱动的情节线,从而全面展示 LLM 如何处理社会互动。实验表明,LLM 在两项 SI 评估上均落后于人类,表现出亲社会性,并偏好更积极的社会行为,即使这些行为会导致目标失败。对 LLM 形成的表示空间和神经元激活的分析表明,LLM 已经发展出类似于人脑的特定功能分区。
引用
@article{arxiv.2506.00900,
title = {SocialEval: Evaluating Social Intelligence of Large Language Models},
author = {Jinfeng Zhou and Yuxuan Chen and Yihan Shi and Xuanming Zhang and Leqi Lei and Yi Feng and Zexuan Xiong and Miao Yan and Xunzhi Wang and Yaru Cao and Jianing Yin and Shuai Wang and Quanyu Dai and Zhenhua Dong and Hongning Wang and Minlie Huang},
journal= {arXiv preprint arXiv:2506.00900},
year = {2025}
}
备注
ACL 2025, Repository: \url{https://github.com/thu-coai/SocialEval}