VLM-RL:面向安全自动驾驶的视觉语言模型与强化学习统一框架
机器人学
2024-12-23 v1 人工智能
计算机视觉与模式识别
摘要
近年来,基于强化学习(RL)的驾驶策略学习方法在自动驾驶社区中受到越来越多的关注,并在各种驾驶场景中取得了显著进展。然而,传统的 RL 方法依赖于人工设计的奖励,这需要大量的人力投入,且往往缺乏泛化能力。为了解决这些局限性,我们提出了 \textbf{VLM-RL},一个将预训练的视觉语言模型(VLM)与 RL 相结合的统一框架,利用图像观测和自然语言目标生成奖励信号。VLM-RL 的核心是对比语言目标(CLG)作为奖励的范式,该范式使用正负语言目标来生成语义奖励。我们进一步引入了一种分层奖励合成方法,将基于 CLG 的语义奖励与车辆状态信息相结合,提高了奖励的稳定性并提供了更全面的奖励信号。此外,采用批处理技术来优化训练过程中的计算效率。在 CARLA 模拟器中的大量实验表明,VLM-RL 优于 SOTA 基线,碰撞率降低了 10.5\%,路线完成率提高了 104.6\%,并且对未见过的驾驶场景具有稳健的泛化能力。此外,VLM-RL 可以无缝集成几乎任何标准 RL 算法,有可能彻底改变依赖人工奖励工程的现有 RL 范式,并实现持续的性能提升。演示视频和代码可访问:https://zilin-huang.github.io/VLM-RL-website。
引用
@article{arxiv.2412.15544,
title = {VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving},
author = {Zilin Huang and Zihao Sheng and Yansong Qu and Junwei You and Sikai Chen},
journal= {arXiv preprint arXiv:2412.15544},
year = {2024}
}
备注
28 pages, 16 figures