RLOC:受神经生物学启发的分层强化学习算法用于非线性动力系统的连续控制
机器学习
2019-03-08 v1 机器学习
摘要
非线性最优控制问题通常通过数值方法求解,这些方法需要系统动力学知识(可能难以推断),并且伴随与迭代计算相关的高计算成本。我们提出了一种新颖的受神经生物学启发的分层学习框架,即强化学习最优控制(Reinforcement Learning Optimal Control,RLOC),它在两个抽象层级上运行,并利用减少数量的控制器来求解连续状态与动作空间中具有未知动力学的非线性系统。我们的方法受两个抽象层级研究的启发:第一,在肢体协调层面,人类行为由线性最优反馈控制理论解释。第二,在涉及学习符号级动作选择的认知任务中,人类使用无模型与基于模型的强化学习算法学习此类问题。我们提出,结合这两个抽象层级可通过减少数量的控制器快速得到非线性控制问题的全局解。我们的框架从初始经验中学习局部任务动力学,并形成局部最优无限 horizon 线性二次调节器(Linear Quadratic Regulator),其产生连续的底层控制。顶层强化学习器将各控制器用作动作,并学习如何在状态空间中最佳组合它们,同时最大化长期奖励。单一的优化控制目标函数通过提供每个所选控制器可取性的训练信号来驱动高层符号学习。我们展示了少量局部最优线性控制器在与强化学习器于此分层框架中结合时,能够求解具有未知动力学的全局非线性控制问题。我们的算法在计算成本和求解质量上可与复杂控制算法竞争,并用基准问题的解说明了这一点。
引用
@article{arxiv.1903.03064,
title = {RLOC: Neurobiologically Inspired Hierarchical Reinforcement Learning Algorithm for Continuous Control of Nonlinear Dynamical Systems},
author = {Ekaterina Abramova and Luke Dickens and Daniel Kuhn and Aldo Faisal},
journal= {arXiv preprint arXiv:1903.03064},
year = {2019}
}
备注
33 pages, 8 figures