中文

利用强化学习探索多目标 COVID-19 缓解政策的帕累托前沿

机器学习 2022-04-12 v1 人工智能 种群与进化

摘要

传染病暴发会对公共卫生与社会进程产生破坏性影响。由于疫情缓解背景下的决策困难,强化学习提供了一种结合复杂疫情模型自动学习预防策略的方法。当前研究聚焦于针对单一目标(如病原攻击率)优化政策。然而,由于疫情缓解涉及不同且可能冲突的准则(如患病率、死亡率、发病率、成本),有必要采用多目标方法以学习平衡政策。为将这一决策过程提升至真实世界疫情模型,我们应用深度多目标强化学习,并基于前沿算法 Pareto Conditioned Networks(PCN)学习一组近似该决策问题帕累托前沿的解。我们考虑了比利时第一波由封锁缓解的 COVID-19 疫情,研究不同的解封策略,旨在同时最小化 COVID-19 病例(即感染与住院)与所施加缓解措施引发的社会负担。我们贡献了一个多目标马尔可夫决策过程,其封装了疫情期间用于为决策者提供信息的随机仓室模型。由于这些社会缓解措施在连续动作空间中实施以调节年龄结构疫情模型的接触矩阵,我们将 PCN 扩展至该设定。我们评估了 PCN 返回的解,并观察到每当住院率足够低时,它正确地学习到减轻社会负担。因此,本工作表明多目标强化学习在复杂流行病学模型中是可实现的,并为平衡复杂缓解政策提供了重要见解。

关键词

引用

@article{arxiv.2204.05027,
  title  = {Exploring the Pareto front of multi-objective COVID-19 mitigation policies using reinforcement learning},
  author = {Mathieu Reymond and Conor F. Hayes and Lander Willem and Roxana Rădulescu and Steven Abrams and Diederik M. Roijers and Enda Howley and Patrick Mannion and Niel Hens and Ann Nowé and Pieter Libin},
  journal= {arXiv preprint arXiv:2204.05027},
  year   = {2022}
}