CVD-STORM:用于自动驾驶的跨视图视频扩散模型
计算机视觉与模式识别
2025-10-17 v2
摘要
生成模型已广泛应用于世界建模,以用于环境仿真和未来状态预测。随着自动驾驶技术的发展,不仅需要在各种控制条件下生成高保真视频,还需要生成多样且有意义的信息,如深度估计。为此,我们提出 CVD-STORM,一种跨视图视频扩散模型,利用空间-时间重构变分自编码器 (VAE) 在各种控制输入下生成具有 4D 重构能力的长期多视图视频。我们的方法首先通过辅助 4D 重构任务微调 VAE,以增强其编码 3D 结构和时间动力学的能力。随后,我们将其集成到视频扩散过程中,以显著提高生成质量。实验结果表明,模型在 FID 和 FVD 指标上均实现了显著提升。此外,联合训练的高斯光束解码器有效地重建了动态场景,为综合场景理解提供了宝贵的几何信息。我们的项目页面为 https://sensetime-fvg.github.io/CVD-STORM。
引用
@article{arxiv.2510.07944,
title = {CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving},
author = {Tianrui Zhang and Yichen Liu and Zilin Guo and Yuxin Guo and Jingcheng Ni and Chenjing Ding and Dan Xu and Lewei Lu and Zehuan Wu},
journal= {arXiv preprint arXiv:2510.07944},
year = {2025}
}