S$^3$IT:空间位置社交智能测试基准
人工智能
2025-12-24 v1 计算机与社会
摘要
将具身智能体集成到人类环境中需要具身社交智能:在物理约束和社交规范之间进行推理。然而,现有的评估未能解决这一集成问题,因为它们局限于要么离散的社交推理(例如在文本中),要么社交中性的物理任务。两种方法都无法评估智能体在现实、具身的情境中集成和权衡物理与社交约束的能力。为解决此挑战,我们引入了空间位置社交智能测试(SIT),一个专为评估具身社交智能而设计的基准测试。它以 novel and 挑战性的座位排序任务为中心,需要智能体在3D环境中为一组由大型语言模型驱动的(LLM-driven)NPCs安排座位,这些NPCs具有多样的身份、偏好和复杂的人际关系。我们的可程序化可扩展框架生成广泛且多样的情景空间,可控难度,迫使智能体通过主动对话获取偏好,通过自主探索感知环境,并在复杂约束网络中执行多目标优化。我们对最先进的LLMs在SIT上的表现进行了评估,发现它们在这方面仍然困难,显示出与人类基准之间的明显差距。结果表明,LLMs在空间智能方面存在不足,但同时又展示了其在解决具有明确文本线索的冲突方面接近人类水平能力。
引用
@article{arxiv.2512.19992,
title = {S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test},
author = {Zhe Sun and Xueyuan Yang and Yujie Lu and Zhenliang Zhang},
journal= {arXiv preprint arXiv:2512.19992},
year = {2025}
}
备注
10 pages, 9 figures