中文

Sce2DriveX:面向场景到驾驶学习的通用 MLLM 框架

计算机视觉与模式识别 2025-02-24 v1 人工智能

摘要

端到端自动驾驶直接将原始传感器输入映射到低层车辆控制,是具身智能中的重要组成部分。尽管在应用多模态大语言模型 (MLLM) 进行高级交通场景语义理解方面取得了成功,但将这些概念性语义理解有效转化为低层运动控制指令并实现跨场景驾驶的泛化与一致性仍然具有挑战性。我们引入 Sce2DriveX,一个类人驾驶链式思维 (CoT) 推理 MLLM 框架。Sce2DriveX 利用来自局部场景视频和全局 BEV 地图的多模态联合学习,深入理解长程时空关系和道路拓扑,增强其在 3D 动态/静态场景中的综合感知与推理能力,实现跨场景的驾驶泛化。基于此,它重构了人类驾驶中固有的隐式认知链,涵盖场景理解、元动作推理、行为解释分析、运动规划与控制,从而进一步弥合了自动驾驶与人类思维过程之间的鸿沟。为提升模型性能,我们 developed 了首个专为 3D 空间理解和长轴任务推理量身定制的大规模视觉问答 (VQA) 驾驶指令数据集。广泛的实验表明,Sce2DriveX 在场景理解到端到端驾驶方面实现了最先进性能,并在 CARLA Bench2Drive benchmark 上表现出鲁健的泛化能力。

关键词

引用

@article{arxiv.2502.14917,
  title  = {Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning},
  author = {Rui Zhao and Qirui Yuan and Jinyu Li and Haofeng Hu and Yun Li and Chengyuan Zheng and Fei Gao},
  journal= {arXiv preprint arXiv:2502.14917},
  year   = {2025}
}