中文

为 AGI 为何需要世界模型:LLM 的局限与世界模型的潜在优势

人工智能 2026-05-26 v1 计算与语言 机器人学

摘要

大型语言模型在语言生成和知识密集型任务方面取得了强大的性能,但在需要因果推理、持久状态跟踪和长期规划的情境中仍受限。我们认为,这些局限可能源于序列预测与潜在环境动力学推理之间的目标层次不匹配。为 formalize 这一区别,我们引入了潜在动力学推断(LDI)概念视角,将语言和多模态观察解释为底层转换动力学的部分证据。为探索这一视角,我们引入了 Flux,一个完全通过自然语言规则指定的顺序推理环境。作为概念案例研究,首先将规则编译成显式状态转换模拟器,说明结构化的潜在状态转换动力学在某些情况下可从文本规则描述中提取。这使得能够在仅凭文本观察的 LLM 与直接在提取的潜在状态空间中训练的强化学习智能体之间进行受控比较。在该案例研究中,拥有显式访问潜在状态空间的智能体在长期游戏中表现更为稳定,约以 79% 的综合胜率击败 LLM 的 11%。定性分析进一步揭示了一系列不稳定持久状态跟踪的失败模式,包括无效动作、状态跟踪错误和短期规划失败。Flux 环境的完整实现已公开于 https://github.com/FeisalAlaswad/FLUX-RL-Agent 在评估设置下,这些结果表明,仅凭强大的序列预测可能难以在没有持久状态跟踪和转换建模机制的情况下支持稳健的长期动态推理。

关键词

引用

@article{arxiv.2605.23972,
  title  = {Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform},
  author = {Feisal Alaswad and Batoul Aljaddouh and Maher Alrahhal and Poovammal E and Talal Bonny},
  journal= {arXiv preprint arXiv:2605.23972},
  year   = {2026}
}

备注

19 pages, 5 figures