中文

LLM 世界模型是心理的:输出层证据显示 LLM 机械推理中的脆弱世界模型使用

人工智能 2025-07-22 v1

摘要

大型语言模型(LLMs)是否构建和操作内部世界模型,或仅依赖表示为输出层标记概率的统计关联?我们采用认知科学方法中的人类心理模型研究方法,对 LLMs 在斜轮系统问题上进行测试,使用 TikZ 渲染的刺激物。研究 1 检查 LLMs 是否能够估计机械优势(MA)。最先进的模型在略微但显著高于随机猜测,且其估计值与真实 MA 之间存在显著相关性。这表明模型采用了斜轮计数启发式方法,而不一定模拟斜轮系统以推导精确值。研究 2 通过探测 LLMs 是否代表估计 MA 所必需的全局特征来检验这一点。模型对功能连接的斜轮系统进行评估,而针对一个随机放置组件的假系统进行评估。在没有明确线索的情况下,模型识别出功能系统的 MA 较大,准确率为 F1=0.8,这表明 LLMs 能够足够地代表系统组件的空间关系。研究 3 进一步要求 LLMs 比较功能系统与匹配系统——后者虽已连接,但未将力量传递给重量。LLMs 识别出功能系统,准确率为 F1=0.46,这表明模型可能仅进行随机猜测。尽管在某些方面可能具有概括性,这些发现与 LLMs 操作内部世界模型的假设相容,这足以利用斜轮计数与 MA 之间的统计关联(研究 1),以及大致代表系统组件空间关系(研究 2)。然而,他们可能缺乏处理细致结构连接的能力(研究 3)。我们通过倡导认知科学方法来评估人工智能系统的世界建模能力,作出结论。

关键词

引用

@article{arxiv.2507.15521,
  title  = {LLM world models are mental: Output layer evidence of brittle world model use in LLM mechanical reasoning},
  author = {Cole Robertson and Philip Wolff},
  journal= {arXiv preprint arXiv:2507.15521},
  year   = {2025}
}

备注

Manuscript comprises 14 pages, 4 figures, 4 tables in the Technical Appendix and Supplementary Material, and is under review at NeurIPS 2025