面向离散时序马尔可夫跳变线性系统的模型自由最优控制:基于 Q-learning 的方法
系统与控制
2024-08-07 v1 系统与控制
摘要
本研究论文引入了一种用于离散时序马尔可夫跳变线性系统(MJLS)的模型自由最优控制器,采用强化学习(RL)的方法论。尽管 Q-learning 方法在确定性系统中用于确定最优控制增益方面已显示出有效性,但其应用于具有马尔可夫切换的系统尚未探索。为填补这一研究空白,我们提出了包含马尔可夫模式的 Q 函数。随后,提出了一种 Q-learning 算法用于学习使用系统原始输入-状态信息的未知核矩阵。值得注意的是,本文证明了所提出的 Q-learning 最优控制增益在证明价值迭代算法收敛性后,收敛于模型基最优控制增益。对输入添加激发噪声以确保学习性能,不会导致任何偏差。与传统最优控制器不同,所提方法不需要对系统动力学进行任何知识,也消除了在 MJLS 最优控制中出现的求解耦合代数Riccati 方程的需求。最后,通过仿真研究展示了所提方法的效率。
引用
@article{arxiv.2408.03077,
title = {Model-free optimal controller for discrete-time Markovian jump linear systems: A Q-learning approach},
author = {Ehsan Badfar and Babak Tavassoli},
journal= {arXiv preprint arXiv:2408.03077},
year = {2024}
}