WorldWarp:用于异步视频扩散的 3D 几何传递
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
生成长程、几何一致的视频呈现一种根本性困境:尽管一致性要求在像素空间严格遵循 3D 几何,而最先进的生成模型在相机条件化潜在空间中运作最为有效。这种间隔导致当前方法在遮挡区域和复杂相机轨迹方面受限。为弥合这一差距,我们提出 WorldWarp,一个将 3D 结构锚与 2D 生成细化器耦合的框架。为建立几何 grounding,WorldWarp 通过高斯溅射 (3DGS) 构建在线 3D 几何缓存。通过显式将历史内容 warping 到新视角,该缓存充当结构支架,确保每个新帧遵循先前几何。然而,静态 warping 必然因遮挡而留下洞穴和制件。我们采用面向 "填充与修订" 目标的时空扩散 (ST-Diff) 模型。我们的关键创新是时空可变噪声计划:空白区域接收完整噪声以触发生成,而 warping 区域接收部分噪声以启用细化。通过在每一步动态更新 3D 缓存,WorldWarp 在视频块之间维持一致性。因此,它实现了最先进的保真度,通过确保 3D 逻辑指导结构而扩散逻辑完善纹理。项目页面:https://hyokong.github.io/worldwarp-page/。
引用
@article{arxiv.2512.19678,
title = {WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion},
author = {Hanyang Kong and Xingyi Yang and Xiaoxu Zheng and Xinchao Wang},
journal= {arXiv preprint arXiv:2512.19678},
year = {2025}
}
备注
Project page: https://hyokong.github.io/worldwarp-page/