通过模仿学习预训练改进面向基于图像自动驾驶的强化学习
机器学习
2019-07-17 v1 人工智能
计算机视觉与模式识别
图像与视频处理
摘要
我们提出一种自动驾驶任务的训练流程,以当前相机图像和车速为输入,产生油门、刹车和转向控制输出。模拟器 Airsim 便捷的天气与光照 API 在训练期间提供了充分的多样性,有助于提升训练策略的鲁棒性。为不限制可能策略的性能,我们采用连续确定性控制策略设定。我们利用 ResNet-34 作为 actor 与 critic 网络,并在全连接层做了轻微改动。考虑到人类对该任务的熟练掌握及任务的高复杂性,我们首先使用模仿学习来模仿给定的人类策略,并将训练得到的策略及其权重迁移至强化学习阶段,该阶段我们使用 DDPG。与纯模仿学习和纯 DDPG 相比,这种组合在自动驾驶任务上显示出显著的性能提升。
引用
@article{arxiv.1907.06838,
title = {Improved Reinforcement Learning through Imitation Learning Pretraining Towards Image-based Autonomous Driving},
author = {Tianqi Wang and Dong Eui Chang},
journal= {arXiv preprint arXiv:1907.06838},
year = {2019}
}
备注
5 pages, 2019 19th International Conference on Control, Automation and Systems (ICCAS 2019)