InterIntent:通过交互式游戏情境中的意图理解探讨大语言模型的社交智能
人工智能
2024-11-05 v3
摘要
大语言模型(LLMs)已展示出模仿人类社交智能的潜力。然而,大多数研究聚焦于简洁且静态的自报告或基于绩效的测试,这限制了分析的深度和有效性。在本文中,我们开发了一种新框架 InterIntent,通过映射其理解和管理意图能力于游戏情境中的能力来评估 LLM 的社交智能。我们关注四个社交智能维度:情境意识、自我调节、自我意识和心智理论。每个维度都链接到特定的游戏任务:意图选择、意图跟随、意图总结和意图推测。我们的发现表明,尽管 LLMs 在选择意图方面表现出高熟练度,准确率达 88%,但其推断他人意图的能力显著较弱,落后于人类约 20%。此外,游戏表现与意图理解呈相关性,这凸显了四个组成部分对于此游戏成功的重要性。这些发现凸显了意图理解在评估 LLM 社交智能方面的关键作用,并凸显了将社交推理游戏作为复杂测试舞台来增强 LLM 评估的潜力。InterIntent 为弥合 multiplayer 游戏中社交智能评估的评估差距贡献了一种结构化方法。
引用
@article{arxiv.2406.12203,
title = {InterIntent: Investigating Social Intelligence of LLMs via Intention Understanding in an Interactive Game Context},
author = {Ziyi Liu and Abhishek Anand and Pei Zhou and Jen-tse Huang and Jieyu Zhao},
journal= {arXiv preprint arXiv:2406.12203},
year = {2024}
}