中文

StreetCrafter:基于可控视频扩散模型的街景合成

计算机视觉与模式识别 2025-08-27 v3

摘要

本文旨在解决基于车辆传感器数据的逼真视图合成问题。神经场景表示的最新进展在渲染高质量自动驾驶场景方面取得了显著成功,但当视点偏离训练轨迹时,性能会显著下降。为缓解此问题,我们引入了 StreetCrafter,一种新颖的可控视频扩散模型,该模型利用 LiDAR 点云渲染作为像素级条件,充分利用生成先验进行新视图合成,同时保持精确的相机控制。此外,像素级 LiDAR 条件的使用使我们能够对目标场景进行精确的像素级编辑。另外,StreetCrafter 的生成先验可以有效地融入动态场景表示中,以实现实时渲染。在 Waymo Open Dataset 和 PandaSet 上的实验表明,我们的模型能够灵活控制视点变化,扩大视图合成区域以获得令人满意的渲染效果,优于现有方法。

关键词

引用

@article{arxiv.2412.13188,
  title  = {StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models},
  author = {Yunzhi Yan and Zhen Xu and Haotong Lin and Haian Jin and Haoyu Guo and Yida Wang and Kun Zhan and Xianpeng Lang and Hujun Bao and Xiaowei Zhou and Sida Peng},
  journal= {arXiv preprint arXiv:2412.13188},
  year   = {2025}
}

备注

Project page: https://zju3dv.github.io/street_crafter