中文

S4-Driver:基于时空视觉表征的可扩展自监督驾驶多模态大语言模型

计算机视觉与模式识别 2025-06-04 v2 人工智能

摘要

多模态大语言模型(MLLM)的最新进展激发了人们对自动驾驶端到端运动规划方法的强烈 renewed 兴趣。许多端到端方法依赖人类标注来学习中间感知和预测任务,而纯自监督方法——直接从传感器输入生成规划轨迹而无需人类标注——通常表现不如最先进技术。我们观察到输入表征空间存在一个关键差距:基于MLLM构建的端到端方法通常在2D图像空间中通过推理任务进行预训练,而不是自动驾驶车辆进行规划的固有3D空间。为此,我们提出了S4-Driver,一种基于流行的PaLI多模态大语言模型、具有时空视觉表征的可扩展自监督运动规划算法。S4-Driver使用一种新颖的稀疏体素策略,将MLLM强大的视觉表征从透视图无缝转换到3D空间,而无需微调视觉编码器。这种表征聚合了多视图和多帧视觉输入,并能够在3D空间中更好地预测规划轨迹。为了验证我们的方法,我们在nuScenes和Waymo Open Motion Dataset(带有内部相机数据)上进行了实验。结果表明,S4-Driver在与现有的监督多任务方法对比中表现良好,且不需要人类标注。当在大规模未标注驾驶日志上进行预训练时,它也展现出极大的可扩展性。

关键词

引用

@article{arxiv.2505.24139,
  title  = {S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation},
  author = {Yichen Xie and Runsheng Xu and Tong He and Jyh-Jing Hwang and Katie Luo and Jingwei Ji and Hubert Lin and Letian Chen and Yiren Lu and Zhaoqi Leng and Dragomir Anguelov and Mingxing Tan},
  journal= {arXiv preprint arXiv:2505.24139},
  year   = {2025}
}

备注

Accepted by CVPR2025; Project website: s4-driver.github.io