中文

面向具身多智能体系统的社交推理规划基准——SocialGrid

人工智能 2026-04-20 v1 机器学习 多智能体系统

摘要

随着大型语言模型(LLM)从文本处理器转向自主智能体,评估其在具身多智能体环境中的社交推理变得至关重要。我们引入SocialGrid,一个受Among Us启发的具身多智能体环境,用于评估LLM智能体在规划、任务执行和社交推理方面的能力。我们的评估显示,即使是最强大的开源模型(GPT-OSS-120B)在任务完成和规划方面的准确率也低于60%,智能体会陷入重复行为或无法导航基本障碍。由于差异的导航会混淆社交智能的评估,SocialGrid提供可选的规划信使来隔离社交推理缺陷。尽管规划帮助提高了任务完成率,但社交推理仍然是一个瓶颈:智能体在几乎以随机水平检测欺骗方面的表现不佳,依赖浅层启发式而非积累行为证据。SocialGrid提供自动化故障分析和细粒度指标,使开发人员能够诊断和改进他们的智能体。我们还通过对抗性联赛游戏的Elo评级建立了竞争性排行榜。

关键词

引用

@article{arxiv.2604.16022,
  title  = {SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems},
  author = {Hikaru Shindo and Hanzhao Lin and Lukas Helff and Patrick Schramowski and Kristian Kersting},
  journal= {arXiv preprint arXiv:2604.16022},
  year   = {2026}
}

备注

Preprint