面向端到端自动驾驶的查询高效模仿学习
机器学习
2016-05-23 v1 人工智能
机器人学
摘要
实现端到端自动驾驶的一种途径是通过模仿专家驾驶员或参考策略,学习一个从感官输入(如前置摄像头图像帧)到驾驶动作的映射策略函数。这可通过监督学习完成,即调整策略函数以最小化预测动作与真实动作之间的差异。然而,以此方式训练的策略函数已知会因参考策略与训练后策略函数可达状态之间的不匹配而产生意外行为。更先进的模仿学习算法(如DAgger)通过从参考策略和训练策略迭代收集训练样本来解决此问题。这些算法通常需要对参考策略进行大量查询,这并不理想,因为参考策略往往代价高昂。本文提出一种DAgger的扩展算法SafeDAgger,其查询高效且更适用于端到端自动驾驶。我们在赛车模拟器中评估所提SafeDAgger,表明其确实需要对参考策略的更少查询。我们观察到收敛速度显著提升,推测这源于自动化课程学习的效果。
引用
@article{arxiv.1605.06450,
title = {Query-Efficient Imitation Learning for End-to-End Autonomous Driving},
author = {Jiakai Zhang and Kyunghyun Cho},
journal= {arXiv preprint arXiv:1605.06450},
year = {2016}
}