中文

基于预测感知与强化学习的利他协同驾驶

机器人学 2025-12-11 v1 人工智能

摘要

在有人驾驶车辆(HVs)存在的情况下,自动驾驶车辆(AV)的导航具有挑战性,因为 HVs 会持续根据 AVs 更新其策略。为了在复杂的 AV-HV 社会交互中安全导航,AVs 必须学会预测这些变化。人类之所以能够应对此类具有挑战性的社会交互场景,是因为他们具备关于其他智能体行为的内在知识,并利用该知识预测未来可能发生的情况。受人类启发,我们赋予 AVs 预见未来状态并在协同强化学习(RL)决策框架中利用预测的能力,以提升安全性与鲁棒性。本文中,我们提出将 AVs 两个关键且先前已提出的组成部分——社会导航与预测——进行整合。我们将 AV 决策过程建模为 RL 问题,并寻求利用预测感知规划与社会感知优化 RL 框架获得能产生社会有益结果的最优策略。我们还提出一种混合预测网络(HPN)以预测未来观测。该 HPN 用于多步预测链中,计算一段预测未来观测窗口供价值函数网络(VFN)使用。最后,训练一个安全的 VFN,利用先前与预测观测序列优化社会效用,并使用安全优先级器借助可解释的动力学预测屏蔽不安全动作,从而约束 RL 策略。我们将预测感知 AV 与 SOTA 方案进行比较,并在多个仿真场景中展示了效率与安全性方面的性能提升。

关键词

引用

@article{arxiv.2211.10585,
  title  = {Prediction-aware and Reinforcement Learning based Altruistic Cooperative Driving},
  author = {Rodolfo Valiente and Mahdi Razzaghpour and Behrad Toghi and Ghayoor Shah and Yaser P. Fallah},
  journal= {arXiv preprint arXiv:2211.10585},
  year   = {2025}
}