中文

面向多簇爆发控制的资源受限非药物干预优化:基于层次强化学习

机器学习 2026-05-04 v2

摘要

非药物干预(NPIs),如诊断检测和检疫,是控制传染病爆发的关键手段,但常受限于资源有限,尤其在爆发初期。在现实的公共卫生场景中,资源必须在多个不同步调出现的爆发簇之间分配,这些簇的规模和风险各不相同,且争夺共享的资源预算。本文中,一个簇对应由单个感染源病例引发的密切接触群体。因此,必须在不确定性和异构需求下作出决策,同时遵守操作约束。我们将此问题建模为受限的无回饮多臂老虎机问题,提出一种层次强化学习框架。全局控制器学习连续动作成本乘子,用于调整全局资源需求,而通用的局部策略则估计将资源分配给每个簇中 individual 的边际价值。我们在 SARS-CoV-2 的真实情境基于智能体的模拟器中评估了所提方法,该模拟器具有动态到达的簇。 在各种系统规模和检测预算下,我们的方法始终优于受 RMAB 启发和启发式基线方法,提高了爆发控制效果达 20%-30%。实验在最多 40 个并发活跃簇的规模下进一步表明,层次框架高度可扩展,并比 RMAB 启发方法实现更快的决策。

关键词

引用

@article{arxiv.2603.19397,
  title  = {Optimizing Resource-Constrained Non-Pharmaceutical Interventions for Multi-Cluster Outbreak Control Using Hierarchical Reinforcement Learning},
  author = {Xueqiao Peng and Andrew Perrault},
  journal= {arXiv preprint arXiv:2603.19397},
  year   = {2026}
}