中文

稳定化强化学习控制:一种在所有稳定行为上优化的模块化框架

机器学习 2024-03-25 v2 人工智能 系统与控制 系统与控制 最优化与控制

摘要

我们提出一种反馈控制器设计框架,将深度强化学习的优化驱动与无模型优势,与通过使用Youla-Kucera参数化定义搜索域所提供的稳定性保证相结合。行为系统的最新进展使我们能够构建数据驱动的内模型;这使得基于纯输入输出探索数据的Youla-Kucera参数化替代实现成为可能。或许具有独立意义的是,我们表述并分析了此类数据驱动模型在噪声存在下的稳定性。Youla-Kucera方法需要稳定的“参数”用于控制器设计。对于强化学习智能体的训练,所有稳定线性算子的集合通过矩阵分解方法显式给出。此外,利用神经网络给出非线性扩展以表达参数化稳定算子集合,从而能够与标准深度学习库无缝集成。最后,我们展示了这些思想如何应用于调谐固定结构控制器。

关键词

引用

@article{arxiv.2310.14098,
  title  = {Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior},
  author = {Nathan P. Lawrence and Philip D. Loewen and Shuyuan Wang and Michael G. Forbes and R. Bhushan Gopaluni},
  journal= {arXiv preprint arXiv:2310.14098},
  year   = {2024}
}

备注

Postprint; 31 pages. arXiv admin note: text overlap with arXiv:2304.03422