中文

一种在线稳定强化学习框架

系统与控制 2022-11-17 v9 人工智能 机器学习 系统与控制 动力系统

摘要

在线强化学习关注于通过与环境动态交互对智能体进行即时训练。在此,由于应用的具体性,通常无法进行长时间的预训练,而这在离线、无模型方法中(类似于动态规划)是常见做法。此类应用更频繁地出现于工业中,而非纯数字领域(如云服务、视频游戏、数据库管理等),后者正是强化学习已展现成功的领域。相比之下,在线强化学习更类似于利用关于环境的某些模型知识的经典控制。闭环(智能体加环境)的稳定性是此类在线方法的主要挑战。在本文中,我们通过将在线强化学习与经典控制要素(即基于Lyapunov稳定性理论)特殊融合来解决此问题。其思想是立即启动智能体而无预训练,并在专门设计的、保证稳定性的约束下学习近似最优策略。所得方法在针对移动机器人的广泛实验研究中进行了测试。以标称泊车控制器为基线。观察到所提智能体总能成功泊车,同时显著改善代价。尽管许多方法可用于移动机器人控制,我们认为实验显示了基于类Lyapunov约束的在线强化学习智能体的 promising潜力。所提方法可用于需要稳定性的安全关键工业应用。

关键词

引用

@article{arxiv.2207.08730,
  title  = {A framework for online, stabilizing reinforcement learning},
  author = {Grigory Yaremenko and Georgiy Malaniya and Pavel Osinenko},
  journal= {arXiv preprint arXiv:2207.08730},
  year   = {2022}
}