构建COVID-19数据仓库并预测美国县级死亡人数
摘要
随着COVID-19疫情的发展,准确的预测在指导政策决策方面继续发挥着极其重要的作用。在本文中,我们展示了我们持续维护的一个大型数据仓库,其中包含来自多个来源的COVID-19信息。我们利用这些数据开发预测及相应的预测区间,用于预测美国县级COVID-19累计死亡人数在未来两周内的短期轨迹。使用2020年1月22日至6月20日的数据,我们开发并组合多个预测,采用集成技术,得到一个我们称为组合线性与指数预测器(CLEP)的集成。我们的单个预测器包括特定县的指数和线性预测器、跨县汇总数据的共享指数预测器、使用邻县数据的扩展共享指数预测器,以及基于人口统计的共享指数预测器。我们使用过去五天的预测误差来评估死亡预测的不确定性,得到普遍适用的预测区间,即最大(绝对)误差预测区间(MEPI)。MEPI在预测未来两周累计记录死亡人数时,跨县平均的覆盖率超过94%。我们的预测目前正被非营利组织Response4Life用于确定各医院的医疗物资需求,并直接促进了全国医疗物资的分配。我们希望我们在 https://covidseverity.com 的预测和数据仓库能够帮助指导必要的县级决策,并帮助各县为持续抗击COVID-19做好准备。
引用
@article{arxiv.2005.07882,
title = {Curating a COVID-19 data repository and forecasting county-level death counts in the United States},
author = {Nick Altieri and Rebecca L. Barter and James Duncan and Raaz Dwivedi and Karl Kumbier and Xiao Li and Robert Netzorg and Briton Park and Chandan Singh and Yan Shuo Tan and Tiffany Tang and Yu Wang and Chao Zhang and Bin Yu},
journal= {arXiv preprint arXiv:2005.07882},
year = {2020}
}
备注
Authors ordered alphabetically. All authors contributed significantly to this work. All collected data, modeling code, forecasts, and visualizations are updated daily and available at \url{https://github.com/Yu-Group/covid19-severity-prediction}