基于 MORL 的 Pareto 最优疫情干预政策学习
机器学习
2025-10-07 v1 人工智能
计算机与社会
种群与进化
摘要
新冠疫情凸显了需平衡疾病控制与社会经济稳定的干预策略迫切需求。我们设计了一种框架,用于建模和评估疾病传播防治策略。该框架利用多目标强化学习(MORL)——这是由竞争性目标所必需的表述——结合一种新的随机微分方程(SDE)疫情模拟器进行建模。该模拟器经过校准和验证,已与全球新冠数据匹配。我们的模拟器在再现国家级疫情动力学方面远远优于其他常用于强化学习方法中疫情干预的模型。通过在该模拟器上训练 Pareto 条件网络(PCN)智能体,我们展示了疾病控制与经济稳定之间的直接政策权衡。此外,我们证明了该框架的普适性,通过将其扩展至不同流行病学轮廓的疾病(如脊髓灰质瘤和流感),并展示了这些轮廓如何导致智能体发现根本不同的干预政策。为将工作落实于当代政策制定挑战之中,我们将模型应用于肯德纳破坏事件,量化了疫苗覆盖率下降 5% 对遏制疾病传播所需的显著更严格且成本更高的干预措施。该工作提供了一种稳健且可适应的框架,以支持透明、基于证据的公共卫生危机应对政策制定。
关键词
引用
@article{arxiv.2510.03340,
title = {Learning Pareto-Optimal Pandemic Intervention Policies with MORL},
author = {Marian Chen and Miri Zilka},
journal= {arXiv preprint arXiv:2510.03340},
year = {2025}
}