面向空间流行病模拟的奖励工程:基于强化学习的个体行为学习平台
摘要
我们提出了 ContagionRL,这是一个针对空间流行病模拟系统进行奖励工程的 Gymnasium 兼容强化学习平台。与依赖固定行为规则的传统基于代理的模型不同,我们的平台 enables 对奖励函数设计如何影响不同流行情景下所学生存策略的进行严格评估。ContagionRL 将空间 SIRS+D 流行病学模型与可配置的环境参数集成,允许研究人员在包括有限可观测性、不同运动模式以及异构人口动力学等 varied conditions 下对奖励函数进行压力测试。我们评估了五种不同的奖励设计,涵盖从稀疏生存奖励到 novel potential field 方法,在多个 RL 算法(PPO、SAC、A2C)上进行测试。通过系统化的消融研究,我们确定方向性指导和显式遵守激励是稳健策略学习的关键组件。我们的全面评估在不同的感染率、网格大小、可见性约束和运动模式下揭示,奖励函数选择对智能体行为和生存结果具有决定性影响。使用我们 potential field 奖励训练的智能体始终能够实现优异性能,学习到对非药物干预的最大化遵守,同时发展出精细的空间规避策略。该平台的模块化设计 enable 对奖励-行为关系进行系统化探索,弥补了该类模型中奖励工程关注不足的知识空白。ContagionRL 是研究流行病情境下适应性行为响应的有效平台,强调奖励设计、信息结构和环境可预测性在学习中的重要性。我们的代码已公开于 https://github.com/redradman/ContagionRL
引用
@article{arxiv.2511.18000,
title = {Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning},
author = {Radman Rakhshandehroo and Daniel Coombs},
journal= {arXiv preprint arXiv:2511.18000},
year = {2026}
}
备注
38 pages, 15 figures and 18 tables; Accepted to TMLR. OpenReview: https://openreview.net/forum?id=yPEASsx3hk