基于强化学习的方法论用于流行病控制,以新冠疫情为例
统计方法学
2025-11-25 v1 机器学习
统计计算
机器学习
摘要
本文提出了一个实时、数据驱动的流行病控制决策支持框架。我们将 compartments 流行病模型与顺序贝叶斯推断和强化学习 (RL) 控制器相结合,后者自适应地选择干预水平,在疾病负担(如急诊护理单元 (ICU) 负荷)与社会经济成本之间进行权衡。我们利用经验实验和专家反馈构建了特定情境的成本函数。我们研究了两种 RL 策略:一种通过蒙特卡洛网格搜索计算的 ICU 阈值规则,另一种基于贝叶斯后验平均 Q 学习智能体的策略。通过将流行病模型拟合至英国新冠疫情期间公开的 ICU 占用数据,然后在每种 RL 控制器下生成反事实情景,以便将 RL 策略与历史政府策略进行比较。我们发现,在 300 天的时间段内以及对于各种成本参数,两种控制器都显著降低了相对于观察到的干预措施的 ICU 负担,说明贝叶斯顺序学习结合 RL 如何支持流行病控制政策的设计。
引用
@article{arxiv.2511.18035,
title = {On a Reinforcement Learning Methodology for Epidemic Control, with application to COVID-19},
author = {Giacomo Iannucci and Petros Barmpounakis and Alexandros Beskos and Nikolaos Demiris},
journal= {arXiv preprint arXiv:2511.18035},
year = {2025}
}
备注
Submitted to Statistics and Computing. Approx. 26 pages, 10 figures