DreamWorld:基于统一世界建模的视频生成
计算机视觉与模式识别
2026-03-03 v1
摘要
尽管在视频生成方面取得了显著进展,但现有模型仍仅能实现表层的可行性,缺乏对世界的连贯且统一的理解。以往方法通常仅包含单一形式的世界相关知识,或依赖刚性对齐策略来引入额外知识。然而,仅对齐单一世界知识不足以构成需要联合建模多个异构维度(例如物理常识、三维和时间一致性)的世界模型。为此,我们引入DreamWorld,一个统一框架,通过Joint World Modeling Paradigm将互补世界知识整合到视频生成器中,联合预测视频像素和特征以捕获时间动力学、空间几何和语义一致性。然而,单纯优化这些异构目标会导致视觉不稳定和时间抖动。为缓解此问题,我们提出Consistent Constraint Annealing (CCA)以逐步调节训练中的世界级约束,以及Multi-Source Inner-Guidance以在推理阶段强制学习到的世界先验。广泛的评估表明,DreamWorld在世界一致性方面显著提升,相较于Wan2.1在VBench上提升2.26分。代码将在Github公开发布。
引用
@article{arxiv.2603.00466,
title = {DreamWorld: Unified World Modeling in Video Generation},
author = {Boming Tan and Xiangdong Zhang and Ning Liao and Yuqing Zhang and Shaofeng Zhang and Xue Yang and Qi Fan and Yanyong Zhang},
journal= {arXiv preprint arXiv:2603.00466},
year = {2026}
}