Senna:桥接大视觉-语言模型与端到端自动驾驶
计算机视觉与模式识别
2024-10-30 v1 机器人学
摘要
端到端自动驾驶在大规模数据上展现出强大的规划能力,但由于常识有限,在复杂、罕见的场景中仍然面临困难。相比之下,大视觉-语言模型(LVLMs)在场景理解和推理方面表现出色。未来的道路在于融合两种方法的优势。先前使用 LVLMs 预测轨迹或控制信号的方法结果次优,因为 LVLMs 并不适合进行精确的数值预测。本文提出了 Senna,一个结合了 LVLM(Senna-VLM)和端到端模型(Senna-E2E)的自动驾驶系统。Senna 将高层规划与低层轨迹预测解耦。Senna-VLM 生成自然语言形式的规划决策,而 Senna-E2E 预测精确的轨迹。Senna-VLM 利用多图像编码方法和多视图提示进行高效的场景理解。此外,我们引入了面向规划的问答对以及三阶段训练策略,在保留常识的同时增强了 Senna-VLM 的规划性能。在两个数据集上的大量实验表明,Senna 实现了最先进的规划性能。值得注意的是,通过在大规模数据集 DriveX 上预训练并在 nuScenes 上微调,Senna 的平均规划误差显著降低了 27.12%,碰撞率降低了 33.33%,优于未预训练的模型。我们相信 Senna 的跨场景泛化能力和可迁移性对于实现完全自动驾驶至关重要。代码和模型将在 https://github.com/hustvl/Senna 发布。
引用
@article{arxiv.2410.22313,
title = {Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving},
author = {Bo Jiang and Shaoyu Chen and Bencheng Liao and Xingyu Zhang and Wei Yin and Qian Zhang and Chang Huang and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2410.22313},
year = {2024}
}
备注
Project Page: https://github.com/hustvl/Senna