中文

具有线性二次调节器区域的深度强化学习

机器学习 2020-02-27 v2 人工智能 机器人学 系统与控制 系统与控制

摘要

实践者通常依赖计算密集的领域随机化,以确保仿真中训练的强化学习策略能够鲁棒地迁移到真实世界。然而,由于真实系统中存在未建模的非线性,即便此类仿真策略仍可能无法稳定执行以在真实环境中获取经验。在本文中,我们提出了一种新方法,即使对于高度非线性系统,也能保证仿真训练策略输出的稳定吸引域。我们的核心技术是使用“偏置偏移”神经网络来构建控制器并在仿真器中训练网络。改进后的神经网络不仅捕获系统的非线性,而且可证明地在状态空间的某一区域内保持线性,从而可被调节为类似于已知对真实系统稳定的线性二次调节器。我们已通过将摆起倒立摆的仿真策略迁移到真实系统测试了新方法,并证明了其有效性。

关键词

引用

@article{arxiv.2002.09820,
  title  = {Deep Reinforcement Learning with Linear Quadratic Regulator Regions},
  author = {Gabriel I. Fernandez and Colin Togashi and Dennis W. Hong and Lin F. Yang},
  journal= {arXiv preprint arXiv:2002.09820},
  year   = {2020}
}