LLM 心理自我建模中的选择性缺陷:基于行为的心智理论测试
机器学习
2026-05-12 v2 人工智能
计算与语言
摘要
将自己和他人表示为具有知识、意图和信念状态并指导其行为的智能体的能力——心智理论——是一种人类普遍特征,使我们能够驾驭并操控社会世界。它依赖于我们形成自己和他人心理模型的能力。它在人类事务中的普遍性意味着 LLM 在训练数据中见过无数例子,因此可能已经学会了模仿它,但它们是否真的学会了可以在任意设置中部署的因果模型尚不清楚。因此,我们开发了一种新的实验范式,要求受试者形成自己和他人心理状态的表征并战略性地基于它们行动,而不仅仅是描述它们。我们在这个范式上测试了自2024年以来发布的广泛领先的开放和闭源 LLM,以及人类受试者。我们发现:1)2025 年中期之前发布的 LLM 在所有任务上均失败,2)较新的 LLM 在建模他人的认知状态上达到了人类水平的性能,3)即使是最前沿的 LLM 也在我们的自我建模任务上失败——除非提供了一个以推理轨迹形式的草稿板。我们进一步证明了其他建模任务上的认知负荷效应,提供了暗示性证据表明 LLM 在单次前向传播期间使用类似有限容量工作记忆的东西来保持这些心理表征。最后,我们探讨推理模型在自我建模和其他建模任务上成功的机制,并展示它们很容易参与战略欺骗。
引用
@article{arxiv.2603.26089,
title = {Selective Deficits in LLM Mental Self-Modeling in a Behavior-Based Test of Theory of Mind},
author = {Christopher Ackerman},
journal= {arXiv preprint arXiv:2603.26089},
year = {2026}
}
备注
22 pages, 13 figures, 1 table