基于深度强化学习的人类型自动驾驶跟车模型
机器学习
2019-01-04 v1 人工智能
机器学习
摘要
本研究提出一种基于深度强化学习(deep RL)的人类型自动驾驶跟车规划框架。历史驾驶数据被输入仿真环境,其中RL智能体基于奖励函数从试错交互中学习,该奖励函数指示智能体与经验数据的偏离程度。通过这些交互,最终获得一种最优策略,即一种以人车方式将前车与后车的速度、相对速度以及车间距映射为后车加速度的跟车模型。当输入更多数据时,该模型可连续更新。从2015年上海自然驾驶研究中提取的二千个跟车时段用于训练模型,并将其性能与传统及近期数据驱动跟车模型比较。如本研究结果所示,以模拟与观测速度之差为奖励函数并考虑1秒反应延迟的深度确定性策略梯度跟车模型(记为 DDPGvRT)能够比传统及近期数据驱动跟车模型更高精度地重现人类型跟车行为。具体而言,DDPGvRT模型的间距验证误差为18%、速度验证误差为5%,均小于其他模型,包括智能驾驶员模型、基于局部加权回归的模型以及基于常规神经网络的模型。此外,DDPGvRT展现出对不同驾驶情境的良好泛化能力,并可通过持续学习适应不同驾驶员。本研究证明强化学习方法可洞察驾驶员行为,并有助于人类型自动驾驶算法与交通流模型的发展。
引用
@article{arxiv.1901.00569,
title = {Human-Like Autonomous Car-Following Model with Deep Reinforcement Learning},
author = {Meixin Zhu and Xuesong Wang and Yinhai Wang},
journal= {arXiv preprint arXiv:1901.00569},
year = {2019}
}