通过可控长视频生成释放端到端自动驾驶的泛化能力
计算机视觉与模式识别
2024-06-07 v3
摘要
使用生成模型合成新数据已成为自动驾驶中解决数据稀缺问题的实际标准。尽管现有方法能够提升感知模型,但我们发现这些方法未能改善端到端自动驾驶模型的规划性能,因为生成的视频通常少于8帧,且空间和时间不一致性不可忽略。为此,我们提出了Delphi,一种新颖的基于扩散的长视频生成方法,具有跨多视图的共享噪声建模机制以增加空间一致性,以及一个特征对齐模块以实现精确可控性和时间一致性。我们的方法可以生成多达40帧的视频而不损失一致性,这比最先进的方法长约5倍。我们不是随机生成新数据,而是进一步设计一个采样策略,让Delphi生成与那些失败案例相似的新数据,以提高样本效率。这是通过借助预训练的视觉语言模型构建一个失败案例驱动的框架来实现的。我们广泛的实验表明,我们的Delphi生成了更高质量的长视频,超越了先前最先进的方法。因此,仅生成训练数据集大小的4%,我们的框架首次(据我们所知)超越了感知和预测任务,将端到端自动驾驶模型的规划性能提升了25%。
引用
@article{arxiv.2406.01349,
title = {Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation},
author = {Enhui Ma and Lijun Zhou and Tao Tang and Zhan Zhang and Dong Han and Junpeng Jiang and Kun Zhan and Peng Jia and Xianpeng Lang and Haiyang Sun and Di Lin and Kaicheng Yu},
journal= {arXiv preprint arXiv:2406.01349},
year = {2024}
}
备注
Project Page: https://westlake-autolab.github.io/delphi.github.io/, 8 figures