中文

基于 MPC 的稳定性约束马尔可夫决策过程

机器学习 2021-02-03 v1 系统与控制 系统与控制 最优化与控制

摘要

本文考虑在所得策略具有稳定性这一约束下求解折扣马尔可夫决策过程 (MDPs)。实践中 MDPs 基于某种策略近似求解。我们将利用近期提出的在强化学习背景下使用模型预测控制 (MPC) 作为结构化策略的成果,以将稳定性要求直接引入基于 MPC 的策略中。这将在构造上把 MDP 的解限制为稳定策略。MPC 的稳定性理论在无人折扣 MPC 情形下最为成熟。因此,本文首先证明稳定折扣 MDP 可重构为无折扣 MDP。该观察意味着,基于 MPC 且带稳定性要求的策略若稳定则产生折扣 MDP 的最优策略,否则产生最佳稳定策略。

关键词

引用

@article{arxiv.2102.01383,
  title  = {Stability-Constrained Markov Decision Processes Using MPC},
  author = {Mario Zanon and Sébastien Gros and Michele Palladino},
  journal= {arXiv preprint arXiv:2102.01383},
  year   = {2021}
}