基于深度强化学习的跟驰模型的构建与验证
机器学习
2021-09-30 v1 机器人学
信号处理
摘要
我们提出并验证了一种基于深度强化学习的新型跟驰模型。我们的模型被训练以最大化针对自由行驶和跟驰状态外部给定的奖励函数,而不是复现现有的跟驰轨迹。这些奖励函数的参数(如期望速度、时间间隙或加速度)类似于 Intelligent Driver Model(IDM)等传统模型,并允许显式实现不同的驾驶风格。此外,它们部分消除了传统神经网络模型的黑箱性质。该模型在由截断 Ornstein-Uhlenbeck 过程主导的前车速度分布上进行训练,该过程反映了真实的前车运动学。这允许生成任意的驾驶场景和无限的训练数据供应。对于奖励函数的各种参数化以及广泛多样的人工和真实前车数据,该模型表现出无条件弦稳定、舒适且无碰撞的特性。弦稳定性已通过由五个跟驰车辆组成的车队跟随人工和真实前车轨迹进行了测试。与针对相对间隙拟合优度进行标定的 IDM 的交叉比较表明,与传统模型相比,该模型获得了更高的奖励和更好的拟合优度。
引用
@article{arxiv.2109.14268,
title = {Formulation and validation of a car-following model based on deep reinforcement learning},
author = {Fabian Hart and Ostap Okhrin and Martin Treiber},
journal= {arXiv preprint arXiv:2109.14268},
year = {2021}
}