基于强化学习的多车驾驶非零和博弈控制
人工智能
2023-02-09 v1 机器学习
摘要
当车辆在道路上行驶时,其行为会受到周围车辆的影响。预测与决策不应被视为两个独立阶段,因为所有车辆都在交互地做出决策。本文将多车驾驶场景构建为非零和博弈,并提出一种新颖的博弈控制框架,将预测、决策与控制视为一个整体。由于决策由纳什均衡策略做出,该框架考虑了车辆间交互的相互影响。为高效获取策略,采用基于模型的强化学习方法 ADP 求解耦合的 Hamilton-Jacobi-Bellman 方程。驾驶性能由跟踪、效率、安全性和舒适性指标评估。实验表明,我们的算法可通过直接控制加速度与转向角实现完美驾驶。车辆能学习到超车、通行等交互行为。总之,我们提出了一种用于建模多车驾驶的非零和博弈框架,提供了求解纳什均衡驾驶策略的有效途径,并在无信号交叉口进行了验证。
引用
@article{arxiv.2302.03958,
title = {Non-zero-sum Game Control for Multi-vehicle Driving via Reinforcement Learning},
author = {Xujie Song and Zexi Lin},
journal= {arXiv preprint arXiv:2302.03958},
year = {2023}
}