针对不完整数据的自适应堆叠集成流感预测
应用统计
2020-05-19 v2 机器学习
机器学习
摘要
季节性流感每年在美国感染 1000 万至 5000 万人,在高峰发病周使医院不堪重负。被 CDC 称为抵御这些流行病破坏效应的重要工具,流感及流感样疾病(ILI)的准确预测可提前警示公共卫生官员季节性流感爆发的最严重时间和地点。多模型集成预测——即组件模型的加权组合——已在预测中展现出积极效果。流感爆发的集成预测一直是静态的:在季节之初用所有过往 ILI 数据训练,为集成中每个模型生成一组最优权重并保持恒定。我们提出一种自适应集成预测,其(i)在整个流感季节逐周改变模型权重,(ii)仅需当前流感季节数据即可预测,且(iii)通过引入先验分布,将权重向参考等权方法收缩,并对受未来修订影响的观测 ILI 百分比进行调整。我们研究了该先验影响自适应集成性能的能力,并通过交叉验证方法找到最优先验后,将自适应集成性能与等权集成及静态集成进行比较。应用于美国地区和全国层面的短期 ILI 发病预测,我们的自适应模型优于朴素等权集成,且与需要多年训练数据的静态集成性能相当或更优。自适应集成能够在流行期间快速训练与预测,并为寻求可顺应特定季节独特特征的预测工具的公共卫生官员提供实用手段。
引用
@article{arxiv.1908.01675,
title = {Adaptively stacking ensembles for influenza forecasting with incomplete data},
author = {Thomas McAndrew and Nicholas G. Reich},
journal= {arXiv preprint arXiv:1908.01675},
year = {2020}
}
备注
V0.2 added small paragraph on BMA and acknowledgements