中文

马尔可夫决策过程策略的安全区寻找

机器学习 2023-10-10 v2 人工智能 数据结构与算法 机器学习

摘要

给定马尔可夫决策过程的一个策略,我们将安全区定义为状态的一个子集,使得该策略的大部分轨迹被限制在此子集内。安全区的质量由状态数量和逃逸概率(即随机轨迹离开该子集的概率)参数化。当安全区具有较少状态数和低逃逸概率时尤其令人关注。我们研究了寻找最优安全区的复杂度,并表明一般而言该问题在计算上是困难的。我们的主要结果是一个双准则近似学习算法,对逃逸概率和安全区大小均达到近乎 22 的近似因子,且使用多项式大小的样本复杂度。

关键词

引用

@article{arxiv.2202.11593,
  title  = {Finding Safe Zones of policies Markov Decision Processes},
  author = {Lee Cohen and Yishay Mansour and Michal Moshkovitz},
  journal= {arXiv preprint arXiv:2202.11593},
  year   = {2023}
}

备注

NeurIPS 2023