中文

GenDDS: 利用提示到视频生成模型生成多样化驾驶视频场景

计算机视觉与模式识别 2024-08-29 v1 人工智能

摘要

自动驾驶训练需要包含各种交通状况、天气场景和道路类型的多样化数据集。传统的数据增强方法通常难以生成代表罕见事件的场景。为了应对这一挑战,我们提出了GenDDS,一种利用Stable Diffusion XL(SDXL)(一种先进的潜在扩散模型)的能力来生成驾驶场景的新方法。我们的方法涉及使用描述性提示来指导合成过程,旨在生成逼真且多样化的驾驶场景。借助最新的计算机视觉技术(如ControlNet和Hotshot-XL),我们与SDXL一起构建了一个完整的视频生成流程。我们使用包含真实世界驾驶视频的KITTI数据集来训练模型。通过一系列实验,我们证明了我们的模型可以生成高质量、紧密复现真实驾驶场景复杂性和可变性的驾驶视频。这项研究有助于为自动驾驶系统开发复杂的训练数据,并为创建用于仿真和验证目的的虚拟环境开辟了新途径。

关键词

引用

@article{arxiv.2408.15868,
  title  = {GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model},
  author = {Yongjie Fu and Yunlong Li and Xuan Di},
  journal= {arXiv preprint arXiv:2408.15868},
  year   = {2024}
}