探索视频生成与世界模型在自动驾驶中的交互:一项综述
人工智能
2024-11-06 v1 计算机视觉与模式识别
机器人学
摘要
世界模型和视频生成是自动驾驶领域的关键技术,各自都在提升自主系统的鲁棒性和可靠性方面发挥着关键作用。世界模型模拟真实世界的动态,而视频生成模型产生逼真的视频序列,两者正日益被整合以改善自动驾驶车辆的情境感知和决策能力。本文研究了这两种技术之间的关系,重点关注它们的结构相似性,特别是在基于扩散的模型中,如何为驾驶场景的更准确和更连贯模拟做出贡献。我们审视了JEPA、Genie和Sora等领先工作,它们分别代表了世界模型设计的不同方法,从而凸显了世界模型缺乏普遍接受的定义。这些不同的解释凸显了该领域对世界模型如何为各种自动驾驶任务进行优化的不断演进的理解。此外,本文讨论了该领域的关键评估指标,如用于3D场景重建的Chamfer距离和用于评估生成视频内容质量的Fréchet Inception距离(FID)。通过分析视频生成与世界模型之间的交互,本综述识别了关键挑战和未来研究方向,强调了这些技术联合推动自动驾驶系统性能提升的潜力。本文提出的研究成果旨在提供对视频生成与世界模型的整合如何推动更安全、更可靠的自动驾驶车辆开发创新的全面理解。
引用
@article{arxiv.2411.02914,
title = {Exploring the Interplay Between Video Generation and World Models in Autonomous Driving: A Survey},
author = {Ao Fu and Yi Zhou and Tao Zhou and Yi Yang and Bojun Gao and Qun Li and Guobin Wu and Ling Shao},
journal= {arXiv preprint arXiv:2411.02914},
year = {2024}
}