中文

基于强化学习的方法论用于流行病控制,以新冠疫情为例

统计方法学 2025-11-25 v1 机器学习 统计计算 机器学习

摘要

本文提出了一个实时、数据驱动的流行病控制决策支持框架。我们将 compartments 流行病模型与顺序贝叶斯推断和强化学习 (RL) 控制器相结合,后者自适应地选择干预水平,在疾病负担(如急诊护理单元 (ICU) 负荷)与社会经济成本之间进行权衡。我们利用经验实验和专家反馈构建了特定情境的成本函数。我们研究了两种 RL 策略:一种通过蒙特卡洛网格搜索计算的 ICU 阈值规则,另一种基于贝叶斯后验平均 Q 学习智能体的策略。通过将流行病模型拟合至英国新冠疫情期间公开的 ICU 占用数据,然后在每种 RL 控制器下生成反事实情景,以便将 RL 策略与历史政府策略进行比较。我们发现,在 300 天的时间段内以及对于各种成本参数,两种控制器都显著降低了相对于观察到的干预措施的 ICU 负担,说明贝叶斯顺序学习结合 RL 如何支持流行病控制政策的设计。

关键词

引用

@article{arxiv.2511.18035,
  title  = {On a Reinforcement Learning Methodology for Epidemic Control, with application to COVID-19},
  author = {Giacomo Iannucci and Petros Barmpounakis and Alexandros Beskos and Nikolaos Demiris},
  journal= {arXiv preprint arXiv:2511.18035},
  year   = {2025}
}

备注

Submitted to Statistics and Computing. Approx. 26 pages, 10 figures