中文

可数无限状态空间中马尔可夫决策过程最优策略的贝叶斯学习

系统与控制 2024-03-19 v3 机器学习 系统与控制

摘要

许多实际应用的模型(如通信网络或计算系统的排队模型)具有可数无限状态空间。已开发的用于生成最优策略的算法与学习过程主要关注有限状态设定,不能直接应用于这些模型。为弥补此不足,本文研究一类由未知参数 θΘ\theta\in\Theta 支配、定义于可数无限状态空间 X=Z+d\mathcal X=\mathbb{Z}_+^d、具有有限动作空间 A\mathcal A 与无界代价函数的离散时间可数状态空间马尔可夫决策过程(MDP)的最优控制问题。我们采用贝叶斯视角,随机未知参数 θ\boldsymbol{\theta}^*Θ\Theta 上给定的固定先验分布生成。为最优控制未知 MDP,我们提出一种基于动态长度片段 Thompson 采样的算法:在每片段开始时,利用贝叶斯规则形成的后验分布产生参数估计,进而决定该片段所施策略。为确保遵循各参数所选策略得到的马尔可夫链的稳定性,我们施加遍历性假设。由该条件并利用平均代价 Bellman 方程的解,我们建立了算法贝叶斯后悔的上界 O~(dhdAT)\tilde O(dh^d\sqrt{|\mathcal A|T}),其中 TT 为时间范围。最后,为阐明算法的适用性,我们考虑两种动态未知的排队模型,并展示可应用本算法开发近似最优控制算法。

关键词

引用

@article{arxiv.2306.02574,
  title  = {Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space},
  author = {Saghar Adler and Vijay Subramanian},
  journal= {arXiv preprint arXiv:2306.02574},
  year   = {2024}
}