含连续/离散混合变量MDP的策略学习:以马尔可夫跳变系统无模型控制为例
最优化与控制
2020-07-16 v2 机器学习
系统与控制
系统与控制
摘要
马尔可夫跳变线性系统(MJLS)是一类重要的动力系统,出现在许多控制应用中。本文引入控制未知(离散时间)MJLS的问题,作为具有连续/离散混合状态变量的马尔可夫决策过程(MDP)基于策略的强化学习的新基准。与传统线性二次调节器(LQR)相比,我们提出的问题导致一个特殊的混合MDP(具有连续与离散混合变量),并且由于出现一个控制系统的动力学模态的底层马尔可夫跳变参数,带来了显著的新挑战。具体而言,MJLS的状态不构成马尔可夫链,因此不能将MJLS控制问题当作仅含连续状态变量的MDP来研究。然而,可以将状态与跳变参数增广,得到一个具有连续/离散混合状态空间的MDP。我们讨论控制理论如何启发此类混合MDP的策略参数化。随后我们改进广泛使用的自然策略梯度方法,在既不辨识系统动力学也不辨识切换参数转移概率的情况下,直接学习MJLS的最优状态反馈控制策略。我们在不同的MJLS例子上实现了(数据驱动的)自然策略梯度方法。仿真结果表明,自然梯度方法能高效学习未知动力学MJLS的最优控制器。
引用
@article{arxiv.2006.03116,
title = {Policy Learning of MDPs with Mixed Continuous/Discrete Variables: A Case Study on Model-Free Control of Markovian Jump Systems},
author = {Joao Paulo Jansch-Porto and Bin Hu and Geir Dullerud},
journal= {arXiv preprint arXiv:2006.03116},
year = {2020}
}
备注
Accepted to L4DC 2020