马尔可夫决策过程策略的安全区寻找
机器学习
2023-10-10 v2 人工智能
数据结构与算法
机器学习
摘要
给定马尔可夫决策过程的一个策略,我们将安全区定义为状态的一个子集,使得该策略的大部分轨迹被限制在此子集内。安全区的质量由状态数量和逃逸概率(即随机轨迹离开该子集的概率)参数化。当安全区具有较少状态数和低逃逸概率时尤其令人关注。我们研究了寻找最优安全区的复杂度,并表明一般而言该问题在计算上是困难的。我们的主要结果是一个双准则近似学习算法,对逃逸概率和安全区大小均达到近乎 的近似因子,且使用多项式大小的样本复杂度。
引用
@article{arxiv.2202.11593,
title = {Finding Safe Zones of policies Markov Decision Processes},
author = {Lee Cohen and Yishay Mansour and Michal Moshkovitz},
journal= {arXiv preprint arXiv:2202.11593},
year = {2023}
}
备注
NeurIPS 2023