鬼屋:一款用于比较人类与LLM心理模型灵活性的文本游戏
人机交互
2025-03-24 v1 人工智能
神经元与认知
摘要
本研究引入了“鬼屋”,这是一款新颖的文本游戏,旨在比较人类与大语言模型(LLM)在基于模型的推理中的表现。玩家必须在避开幽灵的同时,从3x3网格布局中包含九个房间的房子里逃脱。他们由每次移动时获得的言语线索引导。在研究1中,98名人类参与者的结果显示成功率为31.6%,显著优于测试的七个SOTA LLM。在七个LLM的140次尝试中,只有一次尝试由Claude 3 Opus成功通过。初步结果表明,GPT o3-mini-high的性能可能更高,但未达到人类水平。在研究2中对29名人类参与者移动的进一步分析表明,LLM经常出现随机和不合逻辑的移动,而人类出现此类错误的频率较低。我们的发现表明,当前的LLM在需要主动基于模型的推理的任务中遇到困难,为未来的基准测试提供了启发。
引用
@article{arxiv.2503.16437,
title = {Haunted House: A text-based game for comparing the flexibility of mental models in humans and LLMs},
author = {Brett Puppart and Paul-Henry Paltmann and Jaan Aru},
journal= {arXiv preprint arXiv:2503.16437},
year = {2025}
}