基于强化学习的 COVID-19 大流行周期性封城优化
机器学习
2020-09-11 v1 人工智能
种群与进化
摘要
本工作考察了利用强化学习(RL)优化周期性封城的应用,后者是控制 COVID-19 大流行可用方法之一。该问题被构建为一个用于跟踪参考值的最优控制系统,该参考值对应关键资源(如 ICU 病床)的最大使用水平。然而,我们未使用传统最优控制方法,而是利用 RL 寻找最优控制策略。我们开发了一个框架,使用基于 RL 的开关控制器计算最优周期性封城时机。该基于 RL 的控制器实现为一个与流行病模拟器交互的 RL 智能体,模拟器以扩展 SEIR 流行病模型实现。RL 智能体学习一个策略函数,产生最优的开/封城决策序列,从而优化 RL 奖励函数中指定的目标。使用了两个并行目标:第一个是公共卫生目标,最小化 ICU 病床使用超过 ICU 病床阈值的超出量;第二个是社会经济目标,最小化处于封城状态下的时间。我们假设,当一个地区面临超越资源容量限制的迫近危险,且若实施长期封城会因缺乏必要经济资源以在其间支撑受影响人口而导致严重社会与经济后果时,周期性封城被视为长期封城的临时替代方案。
引用
@article{arxiv.2009.04647,
title = {COVID-19 Pandemic Cyclic Lockdown Optimization Using Reinforcement Learning},
author = {Mauricio Arango and Lyudmil Pelov},
journal= {arXiv preprint arXiv:2009.04647},
year = {2020}
}