WorldWeaver:通过丰富感知生成长期视频世界
计算机视觉与模式识别
2025-08-22 v1
摘要
生成式视频建模取得了显著进展,但确保在长序列上保持结构和时间一致性仍是一个挑战。当前方法主要依赖 RGB 信号,导致在持续时间较长时在对象结构和运动方面积累误差。为解决这些问题,我们引入了 WorldWeaver,一个用于长视频生成的 robust 框架,在统一的长期建模方案中联合建模 RGB 帧和感知条件。我们的训练框架具有三个关键优势:首先,通过从统一表示同时预测感知条件和颜色信息,显著增强了时间一致性和运动动力学;其次,利用深度线索,我们观察到深度线索比 RGB 更抗漂移,构建了一个保留更清晰上下文信息的记忆库,提高了长期视频生成的质量;第三,我们采用分段噪声调度进行训练,以进一步减轻漂移并降低计算成本。在基于扩散和基于流形的模型上进行的大量实验表明,WorldWeaver 在减少时间漂移和提高生成视频保真度方面效果显著。
引用
@article{arxiv.2508.15720,
title = {WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception},
author = {Zhiheng Liu and Xueqing Deng and Shoufa Chen and Angtian Wang and Qiushan Guo and Mingfei Han and Zeyue Xue and Mengzhao Chen and Ping Luo and Linjie Yang},
journal= {arXiv preprint arXiv:2508.15720},
year = {2025}
}
备注
Project page: https://johanan528.github.io/worldweaver_web/