CVPR2024 E2E Challenge 第二名解决方案:使用视觉语言模型的端到端自动驾驶
计算机视觉与模式识别
2025-09-04 v1 机器人学
摘要
端到端自动驾驶近期引起了极大关注。许多工作聚焦于使用模块化深度神经网络构建端到端架构。然而,使用强大的大型语言模型(LLM),尤其是多模态视觉语言模型(VLM)是否能有益于端到端驾驶任务,仍是一个问题。在我们的工作中,我们证明了将端到端架构设计与知识丰富的 VLM 相结合能在驾驶任务中产生出色的性能。值得注意的是,我们的方法仅使用单目相机,并且是排行榜上最佳的纯相机解决方案,展示了基于视觉的驾驶方法的有效性及其在端到端驾驶任务中的潜力。
引用
@article{arxiv.2509.02659,
title = {2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model},
author = {Zilong Guo and Yi Luo and Long Sha and Dongxu Wang and Panqu Wang and Chenyang Xu and Yi Yang},
journal= {arXiv preprint arXiv:2509.02659},
year = {2025}
}
备注
2nd place in CVPR 2024 End-to-End Driving at Scale Challenge