DriveDreamer-2:大语言模型增强的多样化驾驶视频生成世界模型
计算机视觉与模式识别
2024-04-12 v2
摘要
世界模型在自动驾驶领域已展现出优越性,特别是在多视角驾驶视频生成方面。然而,在生成定制化驾驶视频方面仍存在重大挑战。在本文中,我们提出了 DriveDreamer-2,该模型基于 DriveDreamer 框架,并引入大语言模型 (LLM) 以生成用户定义的驾驶视频。具体而言,首先集成 LLM 接口将用户查询转换为智能体轨迹。随后,基于这些轨迹生成符合交通法规的高清地图 (HDMap)。最后,我们提出了统一多视角模型以增强生成驾驶视频的时空一致性。DriveDreamer-2 是首个能够生成定制化驾驶视频的世界模型,它可以以用户友好的方式生成罕见的驾驶视频(例如车辆突然切入)。此外,实验结果表明,生成的视频增强了驾驶感知方法(如 3D 检测和跟踪)的训练。此外,DriveDreamer-2 的视频生成质量超越了其他最先进 (SOTA) 方法,其 FID 和 FVD 分数分别为 11.2 和 55.7,相对提升了 30% 和 50%。
引用
@article{arxiv.2403.06845,
title = {DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation},
author = {Guosheng Zhao and Xiaofeng Wang and Zheng Zhu and Xinze Chen and Guan Huang and Xiaoyi Bao and Xingang Wang},
journal= {arXiv preprint arXiv:2403.06845},
year = {2024}
}
备注
Project Page: https://drivedreamer2.github.io