中文

用于PI控制器整定的元强化学习:一种离线方法

系统与控制 2022-09-20 v2 机器学习 系统与控制

摘要

元学习是机器学习的一个分支,它训练神经网络模型以综合各种数据,从而快速解决新问题。在过程控制中,许多系统具有相似且已被充分理解的动力学,这表明通过元学习创建可泛化的控制器是可行的。在这项工作中,我们提出了一种元强化学习(meta-RL)控制策略,可用于整定比例-积分控制器。我们的meta-RL智能体具有循环结构,通过在闭环中经由隐藏状态变量积累“上下文”来学习系统动力学。该架构使智能体能够自动适应过程动力学的变化。在本文报告的测试中,meta-RL智能体完全离线地在带时延的一阶系统上训练,并在从训练所用相同过程动力学分布中抽取的新异系统上产生了优异结果。一个关键设计要素是能够在训练期间于仿真环境中离线利用基于模型的信息,同时保持无模型策略结构以与真实过程动力学存在不确定性的新异过程交互。元学习是构建样本高效智能控制器的一种有前景的方法。

关键词

引用

@article{arxiv.2203.09661,
  title  = {Meta-Reinforcement Learning for the Tuning of PI Controllers: An Offline Approach},
  author = {Daniel G. McClement and Nathan P. Lawrence and Johan U. Backstrom and Philip D. Loewen and Michael G. Forbes and R. Bhushan Gopaluni},
  journal= {arXiv preprint arXiv:2203.09661},
  year   = {2022}
}

备注

23 pages; postprint