基于奇异扰动近似的降维强化学习控制
系统与控制
2021-02-08 v1 机器学习
系统与控制
摘要
我们提出一组针对线性时不变奇异扰动 (SP) 系统的无模型、降维强化学习 (RL) 最优控制设计。我们首先针对具有未知状态和输入矩阵的通用 SP 系统,提出基于状态反馈和输出反馈的 RL 控制设计。我们利用被控对象内在的时标分离特性,仅对其慢动态学习一个线性二次调节器 (LQR),从而与传统的全维 RL 控制器相比节省大量学习时间。我们使用 SP 近似定理分析了该设计的次优性,并给出闭环稳定的充分条件。此后,我们将两种设计扩展到聚类多智能体一致性网络,其中 SP 特性通过聚类体现。我们为此类网络开发了集中式和按簇块分散式 RL 控制器,且均为降维形式。我们通过相关数值算例的仿真展示了这些控制器的实现细节,并与传统 RL 设计比较以表明我们方法的计算优势。
引用
@article{arxiv.2004.14501,
title = {Reduced-Dimensional Reinforcement Learning Control using Singular Perturbation Approximations},
author = {Sayak Mukherjee and He Bai and Aranya Chakrabortty},
journal= {arXiv preprint arXiv:2004.14501},
year = {2021}
}