少即是多:面向自动驾驶的轻量且强大的视觉语言模型
计算机视觉与模式识别
2026-03-02 v3 人工智能
机器人学
摘要
本文将自动驾驶重新概念化为通用的语言问题,将轨迹规划任务形式化为下一节点预测。我们引入了Max-V1,一个面向一阶段端到端自动驾驶的新框架,得名于著名荷兰赛车手马克斯·维斯特南斯。该框架提出了单次生成范式,契合驾驶的内在序列性。该方法利用视觉语言模型(VLM)的生成能力,使其能够直接从前视摄像头输入进行端到端轨迹预测。该方法的有效性基于从统计建模中派生的原则监督策略。这提供了一个明确的学习目标,使该框架在大规模专家演示下能够通过模仿学习掌握复杂的驾驶策略。经验上,我们的方法在nuScenes数据集上实现了最先进(SOTA)性能,相较于先前基线整体提升超过30%。此外,它在来自多种车辆的跨域数据集上表现出优异的泛化性能,显示出跨车辆鲁棒性和适应性的潜力。凭借这些实证优势,本工作提出了一种能够实现基本驾驶行为的模型,为开发更具能力的自动驾驶智能体奠定了基础。代码将在发表后提供。
引用
@article{arxiv.2510.00060,
title = {Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving},
author = {Sheng Yang and Tong Zhan and Guancheng Chen and Yanfeng Lu and Jian Wang},
journal= {arXiv preprint arXiv:2510.00060},
year = {2026}
}