中文

Vega:通过自然语言指令学习驾驶

计算机视觉与模式识别 2026-03-31 v2 人工智能 机器人学

摘要

视觉-语言-动作模型已重塑自动驾驶,将语言纳入决策过程。然而,大多数现有流水线仅将语言模态用于场景描述或推理,缺乏遵循多样化用户指令实现个性化驾驶的灵活性。为解决这一问题,我们首先构建了一个大规模驾驶数据集 InstructScene,包含约 100,000 个场景,每个场景标注了多样化的驾驶指令及对应的轨迹。随后我们提出一个统一的视觉-语言-世界-动作模型 Vega,用于基于指令的生成与规划。我们采用自回归范式处理视觉输入(视觉)和语言指令(语言),并采用扩散范式生成未来预测(世界建模)和轨迹(动作)。我们使用联合注意力实现模态间的交互,并为不同模态使用独立的投影层以获得更多能力。大量实验表明,我们的方法不仅实现了优越的规划性能,还展现出强大的指令遵循能力,为更智能和个性化的驾驶系统铺平了道路。

关键词

引用

@article{arxiv.2603.25741,
  title  = {Vega: Learning to Drive with Natural Language Instructions},
  author = {Sicheng Zuo and Yuxuan Li and Wenzhao Zheng and Zheng Zhu and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2603.25741},
  year   = {2026}
}

备注

Code is available at https://github.com/zuosc19/Vega