中文

从生成引擎到可操作模拟器:世界模型中物理基础化的必然要求

人工智能 2026-01-23 v1

摘要

世界模型是一种模拟环境在动作下如何演化的人工智能系统,能够通过想象未来进行规划,而非依赖反应式感知。然而,当前的世界模型存在视觉混淆问题:即错误地假设高保真视频生成意味着对物理和因果动力学的理解。我们表明,尽管现代模型擅长预测像素,但它们经常违反不变约束、在干预下失效,并在安全关键的决策制定中崩溃。本综述认为视觉现实主义是世界理解的一个不可靠的代理。相反,有效的世界模型必须编码因果结构、尊重特定领域的约束,并在长周期内保持稳定。我们提出将世界模型重新定义为可操作模拟器而非视觉引擎,强调结构化的 4D 接口、约束感知动力学和闭环评估。以医疗决策制定作为认知压力测试(其中试错是不可能的且错误是不可逆的),我们证明了一个世界模型的价值不是由其推演看起来有多逼真决定的,而是由其支持反事实推理、干预规划和稳健的长期前瞻的能力决定的。

关键词

引用

@article{arxiv.2601.15533,
  title  = {From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models},
  author = {Zhikang Chen and Tingting Zhu},
  journal= {arXiv preprint arXiv:2601.15533},
  year   = {2026}
}