中文

SimLingo: 基于视觉-动作对齐的纯视觉闭环自动驾驶

计算机视觉与模式识别 2025-03-13 v1 机器人学

摘要

将大语言模型(LLMs)集成到自动驾驶中引起了广泛关注,有望提高泛化能力和可解释性。然而,现有方法往往侧重于驾驶或视觉-语言理解,但同时实现高驾驶性能和广泛的语言理解仍然具有挑战性。此外,处理视觉-语言理解的主导方法是使用视觉问答。然而,对于自动驾驶而言,只有当它与动作空间对齐时才有用。否则,模型的回答可能与其行为不一致。因此,我们提出了一种能够处理三个不同任务的模型:(1)闭环驾驶,(2)视觉-语言理解,以及(3)语言-动作对齐。我们的模型 SimLingo 基于视觉语言模型(VLM),仅使用相机,排除昂贵的传感器如激光雷达(LiDAR)。SimLingo 在广泛使用的 CARLA 模拟器上的 Bench2Drive 基准测试中取得了最先进的性能,并且是 CARLA 挑战赛 2024 的获胜者。此外,我们在保持高驾驶性能的同时,在各种语言相关任务上取得了强劲的结果。

关键词

引用

@article{arxiv.2503.09594,
  title  = {SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment},
  author = {Katrin Renz and Long Chen and Elahe Arani and Oleg Sinavski},
  journal= {arXiv preprint arXiv:2503.09594},
  year   = {2025}
}

备注

CVPR 2025. 1st Place @ CARLA Challenge 2024. Challenge tech report (preliminary version of SimLingo): arXiv:2406.10165