中文

一致性三位一体:通用世界模型的定义原则

人工智能 2026-02-27 v1

摘要

能够学习、模拟和推理客观物理规律的世界模型(World Model)的构建,构为人工通用智能(AGI) pursuit 中的基础性挑战。最近的视频生成模型(如 Sora)表明,数据驱动的规模化法则有望逼近物理动力学,而新兴的统一多模态模型(Unified Multimodal Model, UMM)则为整合感知、语言与推理提供了可行的架构范式。尽管已有进展,领域仍缺乏一种原则化的理论框架,以界定通用世界模型所必需的核心属性。本文提出,世界模型必须以“一致性三位一体”(Trinity of Consistency)为基础:以模态一致性(Modal Consistency)作为语义接口,以空间一致性(Spatial Consistency)作为几何基础,以时间一致性(Temporal Consistency)作为因果引擎。通过这一三元视角,我们系统回顾了多模态学习的演进,揭示了从松耦合的专用模块向统一架构迈进的轨迹,后者促成内部世界模拟器的协同涌现。为配合此概念框架,我们引入 CoW-Bench—a 一个以多帧推理与生成场景为中心的基准测试。CoW-Bench 在统一评估协议下,评估视频生成模型与 UMM。我们的工作建立了通用世界模型的原则化路径,阐明了当前系统的局限性与未来进步所需的架构要求。

关键词

引用

@article{arxiv.2602.23152,
  title  = {The Trinity of Consistency as a Defining Principle for General World Models},
  author = {Jingxuan Wei and Siyuan Li and Yuhang Xu and Zheng Sun and Junjie Jiang and Hexuan Jin and Caijun Jia and Honghao He and Xinglong Xu and Xi bai and Chang Yu and Yumou Liu and Junnan Zhu and Xuanhe Zhou and Jintao Chen and Xiaobin Hu and Shancheng Pang and Bihui Yu and Ran He and Zhen Lei and Stan Z. Li and Conghui He and Shuicheng Yan and Cheng Tan},
  journal= {arXiv preprint arXiv:2602.23152},
  year   = {2026}
}

备注

119 pages, 50 figures