AMONGAGENTS:在交互式文本基社会推理游戏中评估大型语言模型
计算与语言
2024-07-25 v2
摘要
战略社会推理游戏是评估语言模型理解与推理能力的有价值测试场,为社会科学、人工智能和战略游戏提供关键见解。本文聚焦于在模拟环境中创建人类行为代理,采用 Among Us 作为研究模拟人类行为的工具。该研究引入文本基游戏环境,命名为 AmongAgents,镜像 Among Us 的动态。玩家扮演太空舱员,任务在于识别正在破坏飞船并消灭船员的可疑人员。在该环境中,分析模拟语言智能体的行为。实验涉及不同配置的 Crewmates 与 Impostor 人格原型的多样化游戏序列。我们的工作表明,最先进的大型语言模型(LLM)能够有效理解游戏规则并基于当前情境做出决策。本工作旨在促进进一步探索 LLM 在目标导向游戏中的应用,这类设置在不完全信息和复杂动作空间中提供了评估语言模型在社会驱动情境下性能的宝贵机会。
引用
@article{arxiv.2407.16521,
title = {AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game},
author = {Yizhou Chi and Lingjun Mao and Zineng Tang},
journal= {arXiv preprint arXiv:2407.16521},
year = {2024}
}
备注
Wordplay @ ACL 2024