中文

DrivingDiffusion:基于布局引导的潜扩散模型多视角驾驶场景视频生成

计算机视觉与模式识别 2023-10-13 v1 人工智能

摘要

随着基于强大且统一的鸟瞰图(BEV)表示的自动驾驶日益普及,对具有精确标注的高质量、大规模多视角视频数据的需求愈发迫切。然而,由于采集与标注成本高昂,此类大规模多视角数据难以获取。为缓解该问题,我们提出一种时空一致的扩散框架 DrivingDiffusion,用于生成由 3D 布局控制的逼真多视角视频。在给定 3D 布局合成多视角视频时存在三大挑战:如何保持 1)跨视角一致性与 2)跨帧一致性?3)如何保证所生成实例的质量?我们的 DrivingDiffusion 通过级联多视角单帧图像生成步骤、多相机共享的单视角视频生成步骤,以及可处理长视频生成的后处理来解决该问题。在多视角模型中,多视角图像的一致性通过相邻相机间的信息交换来保证。在时间模型中,我们主要从第一帧的多视角图像中查询后续帧生成所需关注的信息。我们还引入局部提示(local prompt)以有效提升生成实例的质量。在后处理中,我们通过采用时间滑动窗口算法进一步增强后续帧的跨视角一致性并延长视频长度。无需任何额外成本,我们的模型即可在复杂城市场景中生成大规模逼真多相机驾驶视频,助力下游驾驶任务。代码将公开可用。

关键词

引用

@article{arxiv.2310.07771,
  title  = {DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model},
  author = {Xiaofan Li and Yifu Zhang and Xiaoqing Ye},
  journal= {arXiv preprint arXiv:2310.07771},
  year   = {2023}
}

备注

11 pages