它有多社交?一项针对大语言模型在多用户多轮社交智能体任务中能力的基准测试
计算与语言
2025-05-09 v1 人工智能
社会与信息网络
摘要
将大语言模型(LLMs)的应用扩展到社会生活,而不仅仅是作为一次仅与一人交流的辅助助手,需要LLMs具备在复杂社交环境中独立扮演多用户、多轮社交智能体任务角色的能力。然而,目前尚无可用基准对该能力进行系统性衡量。为填补这一空白,我们首先引入了一个基于社会学原理的智能体任务分级框架。同时,我们提出了一个新颖的基准测试,名为“它有多社交”(以下简称HSII),旨在评估LLMs在综合性社交智能体任务中的社交能力,并对代表性模型进行基准测试。HSII包含四个阶段:格式解析、目标选择、目标切换对话和稳定对话,这些阶段共同评估了LLMs在源自新闻数据集的真实社交互动场景数据集(HSII-Dataset)中的沟通和任务完成能力。我们通过对数据集进行聚类来进行消融研究。此外,我们还研究了思维链(COT)方法对增强LLMs社交表现的影响。由于COT计算成本更高,我们进一步引入了一个新的统计指标——COT复杂度,以量化特定LLMs在特定社交任务中使用COT的效率,并在正确性测量与效率之间取得更好的权衡。我们的各种实验结果表明,我们的基准测试非常适合评估LLMs的社交技能。
引用
@article{arxiv.2505.04628,
title = {How Social is It? A Benchmark for LLMs' Capabilities in Multi-user Multi-turn Social Agent Tasks},
author = {Yusen Wu and Junwu Xiong and Xiaotie Deng},
journal= {arXiv preprint arXiv:2505.04628},
year = {2025}
}