SI-Bench:评估大语言模型在人类间对话中的社交智能
计算与语言
2025-10-28 v1
摘要
随着大型语言模型(LLM)发展出类人能力,他们正越来越多地被用作与人类交互的自主代理。然而,评估它们在真实且复杂社交互动中的表现仍是一个重大挑战。大多数前期研究通过模拟代理间相互作用来构建数据集,无法捕捉到真实人类对话中所见的语言风格和关系动态。为此,我们提出 SI-Bench,这是一个新颖的基准,用于评估大型语言模型中社交智能的各个方面。基于广泛的社会科学理论,SI-Bench 包含 2,221 个来自社交网络应用程序的真实多轮对话。我们进一步选取了 312 条对话进行手动标注,覆盖 8 个主要模型。实验表明,最先进的模型在复杂社交情境下的过程推理方面已超越人类专家,但在回复质量方面仍落后于人类。此外,引入链式思维(CoT)推理可能降低大型语言模型在社交对话任务中的性能。所有数据集均公开于 https://github.com/SI-Bench/SI-Bench.git。
引用
@article{arxiv.2510.23182,
title = {SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations},
author = {Shuai Huang and Wenxuan Zhao and Jun Gao},
journal= {arXiv preprint arXiv:2510.23182},
year = {2025}
}
备注
17 pages, 9 figures