具有线性二次调节器区域的深度强化学习
机器学习
2020-02-27 v2 人工智能
机器人学
系统与控制
系统与控制
摘要
实践者通常依赖计算密集的领域随机化,以确保仿真中训练的强化学习策略能够鲁棒地迁移到真实世界。然而,由于真实系统中存在未建模的非线性,即便此类仿真策略仍可能无法稳定执行以在真实环境中获取经验。在本文中,我们提出了一种新方法,即使对于高度非线性系统,也能保证仿真训练策略输出的稳定吸引域。我们的核心技术是使用“偏置偏移”神经网络来构建控制器并在仿真器中训练网络。改进后的神经网络不仅捕获系统的非线性,而且可证明地在状态空间的某一区域内保持线性,从而可被调节为类似于已知对真实系统稳定的线性二次调节器。我们已通过将摆起倒立摆的仿真策略迁移到真实系统测试了新方法,并证明了其有效性。
引用
@article{arxiv.2002.09820,
title = {Deep Reinforcement Learning with Linear Quadratic Regulator Regions},
author = {Gabriel I. Fernandez and Colin Togashi and Dennis W. Hong and Lin F. Yang},
journal= {arXiv preprint arXiv:2002.09820},
year = {2020}
}