中文

基于自主驾驶的 DriveGenVLM:面向视觉语言模型的真实视频生成

计算机视觉与模式识别 2024-08-30 v1 人工智能

摘要

自主驾驶技术的发展日益需要更精细的方法来理解和预测真实场景。视觉语言模型(Vision Language Models, VLMs)正作为一种具有重要潜力的工具影响自主驾驶。本文提出了 DriveGenVLM 框架,用于生成驾驶视频并利用 VLMs 进行理解。为实现此目标,我们采用基于去噪扩散概率模型(DDPM)的视频生成框架,以预测真实视频序列为目标。随后,我们通过采用 Efficient In-context Learning on Egocentric Videos(EILEV)所知的预训练模型,探讨我们生成的视频是否适合用于 VLMs。该扩散模型使用 Waymo 开放数据集进行训练,并通过 Fr\'echet Video Distance(FVD)分数进行评估,以确保生成视频的质量和真实性。为这些生成的视频提供对应的叙述文本,这在自主驾驶领域可能具有重要价值。这些叙述可以增强交通场景的理解,辅助导航,并提高规划能力。DriveGenVLM 框架中视频生成与 VLMs 的集成,标志着在利用先进人工智能模型解决自主驾驶中复杂挑战方面迈出了重要一步。

引用

@article{arxiv.2408.16647,
  title  = {DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving},
  author = {Yongjie Fu and Anmol Jain and Xuan Di and Xu Chen and Zhaobin Mo},
  journal= {arXiv preprint arXiv:2408.16647},
  year   = {2024}
}