基于深度Q学习与遗传算法的COVID-19大流行政府行动优化新方法
机器学习
2020-05-18 v1 物理与社会
机器学习
摘要
每当国家受到大流行病的威胁时,正如COVID-19病毒的情况,政府应采取正确行动以保障公共卫生并减轻对经济的负面影响。在这方面,政府可以采取两种完全不同的方法:一种是限制性的,其中自我隔离等严厉措施可能严重损害经济;另一种是更自由的,其中更宽松的限制可能使很高比例的人口面临风险。最优方法可能介于两者之间,并且为了做出正确决策,有必要准确估计采取某种措施或不采取措施的未来影响。在本文中,我们使用传染病SEIR流行病学模型(易感-暴露-感染-康复)来表示COVID-19病毒在人群中随时间的演变。为了优化政府可采取的最佳行动序列,我们提出了一种包含两种方法的方法论,一种基于Deep Q-Learning,另一种基于Genetic Algorithms。行动序列(封锁、自我隔离、保持两米距离或不采取限制)根据一个奖励系统进行评估,该系统侧重于实现两个目标:首先,使少数人感染,从而医院不会被重症患者压垮;其次,避免过长时间采取严厉措施,这可能潜在地对经济造成严重损害。所进行的实验证明,我们的方法论是发现政府可采取的、在两方面减少大流行负面影响的行动的有效工具。我们还证明,基于Deep Q-Learning的方法在优化行动序列方面优于基于Genetic Algorithms的方法。
引用
@article{arxiv.2005.07656,
title = {A Deep Q-learning/genetic Algorithms Based Novel Methodology For Optimizing Covid-19 Pandemic Government Actions},
author = {Luis Miralles-Pechuán and Fernando Jiménez and Hiram Ponce and Lourdes Martínez-Villaseñor},
journal= {arXiv preprint arXiv:2005.07656},
year = {2020}
}