CarLLaVA:基于单摄像头的闭环驾驶视觉语言模型
计算机视觉与模式识别
2024-06-17 v1 机器人学
摘要
本技术报告介绍了CarLLaVA,这是一个用于自动驾驶的视觉语言模型(VLM),用于CARLA Autonomous Driving Challenge 2.0。CarLLaVA采用LLaVA VLM的视觉编码器和LLaMA架构作为主干,仅使用摄像头输入即可实现最先进的闭环驾驶性能,无需复杂或昂贵的标签。此外,我们展示了在驾驶输出中预测语言评论的初步结果。CarLLaVA采用半解耦的输出表示,结合路径预测和路标点,既获得了路径控制的优势,又获得了路标点控制的优势。我们提出了一种高效训练配方,可在大型驾驶数据集上进行训练,而无需在简单、平凡数据上浪费计算资源。CarLLaVA在CARLA Autonomous Driving Challenge 2.0传感器轨道中获得了第一名,超过了上一最先进方法458%,超过了最佳同步提交方案32.6%。
引用
@article{arxiv.2406.10165,
title = {CarLLaVA: Vision language models for camera-only closed-loop driving},
author = {Katrin Renz and Long Chen and Ana-Maria Marcu and Jan Hünermann and Benoit Hanotte and Alice Karnsund and Jamie Shotton and Elahe Arani and Oleg Sinavski},
journal= {arXiv preprint arXiv:2406.10165},
year = {2024}
}
备注
Outstanding Champion & Innovation Award @ CARLA Autonomous Driving Challenge 2024; Project video: https://youtu.be/E1nsEgcHRuc