中文

状态聚合在具有最优阈值策略的退化马尔可夫决策过程中的影响

最优化与控制 2024-05-22 v1

摘要

马尔可夫决策过程(MDPs)是在不确定性下进行序贯决策的数学模型,已在医疗保健、制造业、物流等领域得到应用。在这些模型中,决策者观察随机过程的状态,并确定采取何种行动,以最大化期望的总折扣奖励。在许多应用中,真实系统的状态空间很大,并且某些状态的观测可能有限,无法估计转移概率矩阵。为了克服这一点,建模者将真实状态聚合成“超状态”,从而得到更小的状态空间。这种聚合过程提高了计算可处理性,并增加了超状态之间的观测数量。因此,建模者对状态空间的选择导致了转移概率估计的权衡。虽然更粗糙的状态空间离散化在每个状态中提供更多观测来估计转移概率矩阵,但这以状态表征和由此产生的策略建议的精度为代价。在本文中,我们考虑这种建模决策对MDPs策略的影响,其中真实模型预期具有最优阈值策略。我们分析这些MDPs,并提供聚合MDP也具有最优阈值策略的条件。通过模拟研究,我们探讨了更精细和更粗糙聚合之间的权衡。我们展示了在更大的状态空间上策略改进的潜力最大,但在数据有限的情况下聚合MDP更可取。我们讨论了这些发现对必须选择状态空间设计的建模者的意义。

关键词

引用

@article{arxiv.2405.12912,
  title  = {The implications of state aggregation in deteriorating Markov Decision Processes with optimal threshold policies},
  author = {Madeleine Pollack and Lauren N. Steimle},
  journal= {arXiv preprint arXiv:2405.12912},
  year   = {2024}
}