基于鲁棒控制的自动驾驶零样本深度强化学习策略迁移
机器学习
2018-12-11 v1 机器人学
系统与控制
摘要
尽管深度强化学习(deep RL)方法具有许多若应用于自动驾驶则颇为有利的优势,但自动驾驶中真实的深度 RL 应用因源(训练)域与目标(部署)域之间的建模差距而进展缓慢。与当前通常局限于使用不可解释的神经网络表示作为迁移特征的政策迁移方法不同,我们提出迁移自动驾驶中的具体运动学量。我们所提出的基于鲁棒控制(RC)的通用迁移架构(称为 RL-RC)包含一个可迁移的分层 RL 轨迹规划器和一个基于扰动观测器(DOB)的鲁棒跟踪控制器。利用已知标称动力学模型训练的深度 RL 策略被直接迁移至目标域,基于 DOB 的鲁棒跟踪控制用于应对包括车辆动力学误差与侧向力等外部扰动在内的建模差距。我们提供了仿真,验证了所提方法在车道保持、变道与避障等多种驾驶场景中实现零样本迁移的能力。
引用
@article{arxiv.1812.03216,
title = {Zero-shot Deep Reinforcement Learning Driving Policy Transfer for Autonomous Vehicles based on Robust Control},
author = {Zhuo Xu and Chen Tang and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:1812.03216},
year = {2018}
}
备注
Published at IEEE ITSC 2018