InfiniCube:基于世界引导视频模型的无限可控动态 3D 驾驶场景生成
计算机视觉与模式识别
2025-06-27 v2 人工智能
图形学
摘要
我们提出 InfiniCube,一种用于生成高保真度和可控性的无限动态 3D 驾驶场景的可扩展方法。以往的场景生成方法要么受限于规模,要么缺乏沿生成序列的几何和外观一致性。相比之下,我们利用最近在可扩展 3D 表示和视频模型方面的进展,实现了可大规模动态场景生成,并允许通过 HD 地图、车辆边界框和文本描述实现灵活控制。首先,我们构建基于地图条件的稀疏体素的 3D 生成模型,以释放其在无限体素世界生成中的潜力。随后,我们重新利用视频模型并通过一组精心设计的像素对齐引导缓冲区将其锚定在体素世界上,合成一致的外观。最后,我们提出一种快速前馈方法,同时利用体素和像素分支,将动态视频提升为带有可控物体的动态 3D 高斯。我们的方法能够生成可控且逼真的 3D 驾驶场景,大量实验验证了该模型的有效性与优越性。
引用
@article{arxiv.2412.03934,
title = {InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models},
author = {Yifan Lu and Xuanchi Ren and Jiawei Yang and Tianchang Shen and Zhangjie Wu and Jun Gao and Yue Wang and Siheng Chen and Mike Chen and Sanja Fidler and Jiahui Huang},
journal= {arXiv preprint arXiv:2412.03934},
year = {2025}
}
备注
ICCV 2025. Project Page: https://research.nvidia.com/labs/toronto-ai/infinicube/