中文

动态传染病控制中决策依赖的分布鲁棒马尔可夫决策过程方法

最优化与控制 2023-06-27 v1 人工智能 机器学习

摘要

在本文中,我们提出一种分布鲁棒马尔可夫决策过程(DRMDP)方法来解决动态传染病控制问题。易感-暴露-感染-康复(SEIR)模型被广泛用于表示传染病(如 COVID-19)的随机传播。虽然马尔可夫决策过程(MDP)提供了一个数学框架,用于根据 SEIR 模型识别最优行动(如疫苗接种和减少传播的干预)以对抗疾病传播。然而,这些场景中的不确定性要求一种更鲁棒、较少依赖易错假设的方法。我们研究的主要目标是引入一种新的 DRMDP 框架,允许转移动态具有模糊分布。具体而言,我们在决策依赖的模糊集中考虑这些转移概率的最坏情况分布。为克服策略确定相关的计算复杂性,我们提出一种高效的实时动态规划(RTDP)算法,能够基于重构的 DRMDP 模型以准确、及时且可扩展的方式计算最优策略。与经典 MDP 模型的对比分析表明,DRMDP 以更低的成本实现了更低的感染与易感比例。

关键词

引用

@article{arxiv.2306.14051,
  title  = {Decision-Dependent Distributionally Robust Markov Decision Process Method in Dynamic Epidemic Control},
  author = {Jun Song and William Yang and Chaoyue Zhao},
  journal= {arXiv preprint arXiv:2306.14051},
  year   = {2023}
}