中文

论贝尔曼最优性原理与安全约束马尔可夫决策过程中的强化学习

系统与控制 2023-07-13 v3 机器学习 系统与控制 最优化与控制 机器学习

摘要

我们研究安全约束马尔可夫决策过程的最优性,该过程是安全强化学习的底层框架。具体而言,我们考虑一个约束马尔可夫决策过程(具有有限状态和有限动作),其中决策者的目标是在具有一定概率保证的前提下到达目标集同时避开不安全集。因此,任何控制策略下的底层马尔可夫链都将是多链的,因为按定义存在目标集与不安全集。决策者在导航至目标集时还须是最优的(相对于某个代价函数)。这引发了一个多目标优化问题。我们强调,对于具有底层多链结构的约束马尔可夫决策问题,贝尔曼最优性原理可能不成立(如 Haviv 的反例所示)。我们通过将上述多目标优化问题表述为零和博弈来解决该反例,并由此构造了针对拉格朗日量的异步值迭代方案(类似于 Shapley 算法)。最后,我们考虑相同的强化学习问题,并构造了一种改进的 QQ 学习算法用于从数据中学习拉格朗日量。我们还给出了学习拉格朗日量所需迭代次数的下界以及相应的误差界。

关键词

引用

@article{arxiv.2302.13152,
  title  = {On Bellman's principle of optimality and Reinforcement learning for safety-constrained Markov decision process},
  author = {Rahul Misra and Rafał Wisniewski and Carsten Skovmose Kallesøe},
  journal= {arXiv preprint arXiv:2302.13152},
  year   = {2023}
}