中文

LORD:基于大模型的自动驾驶对立奖励设计

机器人学 2024-03-29 v1 人工智能 机器学习

摘要

基于强化学习 (RL) 的自动驾驶已成为数据驱动模仿学习方法的一种有前景的替代方案。然而,由于在不同场景下定义和量化良好驾驶行为的复杂性,为 RL 设计有效的奖励函数面临挑战。近期,大型预训练模型作为针对以期望语言目标指定的任务的零样本奖励模型,受到了广泛关注。然而,自动驾驶中期望的语言目标(如“安全驾驶”)是模糊的,且预训练模型无法理解。另一方面,不期望的语言目标(如“碰撞”)则更加具体且易于处理。在本研究中,我们提出了 LORD,一种基于大模型的通过不期望语言目标进行对立奖励设计的新方法,以实现将大型预训练模型高效地用作零样本奖励模型。通过大量实验,我们提出的框架展示了其在利用大型预训练模型能力以实现安全且增强的自动驾驶方面的有效性。此外,所提出的方法表现出改进的泛化能力,在多样且具挑战性的驾驶场景中优于对应方法。

关键词

引用

@article{arxiv.2403.18965,
  title  = {LORD: Large Models based Opposite Reward Design for Autonomous Driving},
  author = {Xin Ye and Feng Tao and Abhirup Mallik and Burhaneddin Yaman and Liu Ren},
  journal= {arXiv preprint arXiv:2403.18965},
  year   = {2024}
}