SimLingo: 基于视觉-动作对齐的纯视觉闭环自动驾驶
计算机视觉与模式识别
2025-03-13 v1 机器人学
摘要
将大语言模型(LLMs)集成到自动驾驶中引起了广泛关注,有望提高泛化能力和可解释性。然而,现有方法往往侧重于驾驶或视觉-语言理解,但同时实现高驾驶性能和广泛的语言理解仍然具有挑战性。此外,处理视觉-语言理解的主导方法是使用视觉问答。然而,对于自动驾驶而言,只有当它与动作空间对齐时才有用。否则,模型的回答可能与其行为不一致。因此,我们提出了一种能够处理三个不同任务的模型:(1)闭环驾驶,(2)视觉-语言理解,以及(3)语言-动作对齐。我们的模型 SimLingo 基于视觉语言模型(VLM),仅使用相机,排除昂贵的传感器如激光雷达(LiDAR)。SimLingo 在广泛使用的 CARLA 模拟器上的 Bench2Drive 基准测试中取得了最先进的性能,并且是 CARLA 挑战赛 2024 的获胜者。此外,我们在保持高驾驶性能的同时,在各种语言相关任务上取得了强劲的结果。
引用
@article{arxiv.2503.09594,
title = {SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment},
author = {Katrin Renz and Long Chen and Elahe Arani and Oleg Sinavski},
journal= {arXiv preprint arXiv:2503.09594},
year = {2025}
}
备注
CVPR 2025. 1st Place @ CARLA Challenge 2024. Challenge tech report (preliminary version of SimLingo): arXiv:2406.10165