大型语言模型具备规划心智理论吗?来自 MindGames 的证据:一项多步说服任务
计算与语言
2025-07-23 v1
摘要
最近的证据表明,大型语言模型(LLM)展现出心智理论(ToM)能力。大多数 ToM 实验将参与者置于旁观者角色,让他们预测和解释其他智能体的行为。然而,人类的 ToM 也有助于动态规划行动并策略性地干预他人的心理状态。我们提出 MindGames:一种新颖的“规划心智理论”任务,要求智能体推断对话者的信念和愿望以说服其改变行为。与以往的评估不同,我们明确评估了 ToM 的用例。我们发现,在我们的 PToM 任务中,人类的表现显著优于 o1-preview(一种 LLM)(高出 11%;)。我们假设这是因为人类拥有关于其他智能体的隐式因果模型(例如,他们知道,正如我们的任务所要求的那样,去询问人们的偏好)。相比之下,在需要相似规划量但极少心理状态推断的基线条件下,o1-preview 的表现优于人类(例如,当已经给出某人的偏好时,o1-preview 在规划方面比人类更出色)。这些结果表明,类人的社会推理与 LLM 能力之间存在显著差距。
引用
@article{arxiv.2507.16196,
title = {Do Large Language Models Have a Planning Theory of Mind? Evidence from MindGames: a Multi-Step Persuasion Task},
author = {Jared Moore and Ned Cooper and Rasmus Overmark and Beba Cibralic and Nick Haber and Cameron R. Jones},
journal= {arXiv preprint arXiv:2507.16196},
year = {2025}
}
备注
To appear in COLM, 2025