中文

DriveX:面向自动驾驶中可泛化世界知识学习的全场景建模

计算机视觉与模式识别 2025-05-27 v1

摘要

数据驱动的学习推进了自动驾驶,但特定任务模型由于其狭窄的优化目标和对昂贵标注数据的依赖,在分布外场景中表现挣扎。我们提出了 DriveX,这是一个自监督世界模型,从大规模驾驶视频中学习可泛化的场景动态和整体表征(几何、语义和运动)。DriveX 引入了全场景建模(OSM)模块,该模块统一了多模态监督——3D 点云预测、2D 语义表征和图像生成——以捕捉全面的场景演化。为了简化复杂动态的学习,我们提出了一种解耦的潜在世界建模策略,将世界表征学习与未来状态解码分离,并通过动态感知射线采样增强运动建模。为了进行下游适配,我们设计了未来空间注意力(FSA),这是一种统一范式,能够动态聚合来自 DriveX 预测的时空特征,以增强特定任务的推理。大量实验证明了 DriveX 的有效性:它在 3D 未来点云预测方面取得了比先前工作显著的改进,同时在包括占用预测、流估计和端到端驾驶在内的多种任务上获得了 SOTA 结果。这些结果验证了 DriveX 作为通用世界模型的能力,为鲁棒且统一的自动驾驶框架铺平了道路。

关键词

引用

@article{arxiv.2505.19239,
  title  = {DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving},
  author = {Chen Shi and Shaoshuai Shi and Kehua Sheng and Bo Zhang and Li Jiang},
  journal= {arXiv preprint arXiv:2505.19239},
  year   = {2025}
}