基于场景级 BEV 潜在表示的自主驾驶多模态世界模拟器:BEVWorld
计算机视觉与模式识别
2025-05-01 v3 人工智能
摘要
世界模型在自主驾驶中因其能够预测潜在未来情景的能力而受到越来越多的关注。本文提出 BEVWorld,一种将多模态传感器输入转换为统一且紧凑的鸟瞰图 (BEV) 潜在空间,用于整体环境建模的新型框架。该世界模型由两个主要组件构成:多模态标记器和潜在 BEV 序列扩散模型。多模态标记器首先对异构感知数据进行编码,其解码器通过自监督方式中的光线投射渲染将潜在 BEV 标记重构为 LiDAR 和周围视角图像观测。这使得在共享空间表示中实现全景图像和点云数据的联合建模和双向编码-解码成为可能。在此基础上,潜在 BEV 序列扩散模型在给定高级动作标记的条件下,对未来场景进行时间一致性预测,实现对时间轴上的场景级推理。广泛的实验表明,BEVWorld 在自主驾驶基准测试中有效,展示了其在真实未来场景生成方面的能力,以及对下游任务(如感知和运动预测)的益处。
引用
@article{arxiv.2407.05679,
title = {BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents},
author = {Yumeng Zhang and Shi Gong and Kaixin Xiong and Xiaoqing Ye and Xiaofan Li and Xiao Tan and Fan Wang and Jizhou Huang and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2407.05679},
year = {2025}
}
备注
10 pages