中文

通过强化学习对流行病学控制策略进行建模与优化

人工智能 2024-02-13 v1 种群与进化

摘要

大流行病涉及疾病的高传播率,影响全球和地方的健康及经济模式。可以通过对社区实施某些限制来最小化大流行病的影响。然而,在最小化感染率和死亡率的同时,这些限制也可能导致经济危机。流行病学模型有助于提出基于非药物干预(如社交距离、宵禁和封锁)的大流行病控制策略,从而减少这些限制的经济影响。然而,在考虑疾病传播和经济状况的同时设计手动控制策略并非易事。可以通过多目标强化学习 (MORL) 模型设计最优策略,该模型展示了如何利用限制来优化大流行病的结果。在本研究中,我们利用了一种流行病学易感 - 暴露 - 感染 - 康复 - 死亡 (SEIRD) 模型:一种用于逐日虚拟模拟大流行病的 compartmental 模型。我们将 SEIRD 模型与深度双重循环 Q 网络相结合,训练一个强化学习智能体,基于奖励函数在 SEIRD 模拟中实施最优限制。我们测试了两个具有独特奖励函数和大流行病目标的智能体,以获得两种策略。第一个智能体实施长期封锁以减少疾病的初始传播,随后进行周期性和较短的封锁以遏制疾病复发。第二个智能体实现了相似的感染率,但通过实施 10 天封锁和 20 天无限制周期改善了经济状况。这种强化学习与流行病学建模的结合使得在多种大流行病场景中能够同时实现经济缓解和感染控制。

关键词

引用

@article{arxiv.2402.06640,
  title  = {Modeling and Optimization of Epidemiological Control Policies Through Reinforcement Learning},
  author = {Ishir Rao},
  journal= {arXiv preprint arXiv:2402.06640},
  year   = {2024}
}

备注

22 pages, 8 figures