中文

AgentSense:通过交互情景基准化语言智能体的社交智能

计算与语言 2024-11-26 v2 计算机与社会

摘要

大型语言模型 (LLM) 越来越多地被用于赋能自主智能体,在 various fields of behavioral research 中模拟人类。然而,评估其在复杂社交互动中的能力仍然是一个挑战。以往的研究因情景多样性不足、复杂度有限以及单视角聚焦而受到限制。为此,我们引入 AgentSense:通过交互情景基准化语言智能体的社交智能。drawing on Dramaturgical Theory,AgentSense 采用自下而上的方法创建 1,225 个多样化社交情景,由 extensive scripts 构建。我们通过多轮交互评估 LLM 驱动的智能体,强调目标完成与隐式推理。我们使用 ERG 理论分析目标并进行全面实验。我们的发现表明,LLM 在复杂社交情景中的目标处理能力较弱,尤其是高层次成长需求,甚至 GPT-4o 在私人信息推理方面也需要改进。代码和数据可在 \url{https://github.com/ljcleo/agent_sense} 获取。

关键词

引用

@article{arxiv.2410.19346,
  title  = {AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios},
  author = {Xinyi Mou and Jingcong Liang and Jiayu Lin and Xinnong Zhang and Xiawei Liu and Shiyue Yang and Rong Ye and Lei Chen and Haoyu Kuang and Xuanjing Huang and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2410.19346},
  year   = {2024}
}