中文

基于BLIP引导的融合PPO:面向自动驾驶车道保持的视觉语言深度强化学习框架

机器人学 2025-10-28 v1 人工智能 计算机视觉与模式识别 机器学习 软件工程

摘要

本文提出Bootstrapped Language-Image Pretraining驱动的融合状态表示在近端策略优化(BLIP-FusePPO)中,一种新的多模态强化学习(RL)框架,用于自动车道保持(LK),其中由视觉语言模型(VLM)生成的语义嵌入直接与几何状态、LiDAR观测以及比例-积分-微分控制反馈(PID)融合于智能体观测空间中。该方法的提出使智能体能够学习了解感周环境并易于理解的驾驶规则,通过将来自VLM的高级场景理解与低级控制和空间信号相结合。我们的架构将语义、几何和控制感知表示整合,以提高策略学习的鲁棒性。混合奖励函数包括语义对齐、LK准确性、障碍物规避和速度调节,有助于提高学习的效率和可泛化性。我们的方法不同于仅使用语义模型来塑造奖励的做法,相反,它直接将语义特征嵌入状态表示中。这减少了昂贵的运行时推断,确保语义指导始终可用。仿真结果表明,所提出的模型在各种困难驾驶情境下,比最佳基于视觉的和多模态RL基线在LK稳定性和适应性方面更优。我们将公开代码。

关键词

引用

@article{arxiv.2510.22370,
  title  = {BLIP-FusePPO: A Vision-Language Deep Reinforcement Learning Framework for Lane Keeping in Autonomous Vehicles},
  author = {Seyed Ahmad Hosseini Miangoleh and Amin Jalal Aghdasian and Farzaneh Abdollahi},
  journal= {arXiv preprint arXiv:2510.22370},
  year   = {2025}
}

备注

https://github.com/Amin-A96/BLIP-FusePPO-A-Vision-Language-Deep-Reinforcement-Learning-Framework-for-Lane-Keeping-in-Autonomous.git