利用互联网搜索信息预测美国 COVID-19 疫情
应用统计
2021-11-04 v2
摘要
随着 COVID-19 在全球肆虐,对疾病传播的准确预测对于态势感知、资源分配和公共卫生决策至关重要。相较于美国疾病控制与预防中心(CDC)收集的传统疾病监测数据,以往研究表明,来自互联网的搜索量等大数据包含追踪传染病动态的宝贵信息。在本研究中,我们评估了使用相关查询的互联网搜索量来追踪和预测 COVID-19 大流行的可行性。我们发现 COVID-19 死亡趋势与“味觉丧失”等症状相关查询的搜索量之间存在强关联。随后,我们进一步开发了一种流感追踪模型,通过将搜索量信息与 COVID-19 时间序列信息相结合,预测美国全国层面未来 4 周的 COVID-19 死亡人数。由于相较于基线时间序列模型在全国层面实现了 20% 的误差降低,我们额外构建了州级 COVID-19 死亡模型,利用跨州跨分辨率的时空框架汇集来自各州、各地区及全国的搜索量与 COVID-19 报告信息。这些 ARGOX 变体随后以赢者通吃的集成方式聚合,以生成最终的州级 4 周预测。数值实验表明,我们的方法稳定优于时间序列基线模型,并在公开可用的基准模型中达到最先进的性能。总体而言,我们表明在 COVID-19 大流行期间疾病动态与相关的公众搜索行为共同演化,而在利用历史病例/死亡人数以及时空跨区域信息的同时捕捉其依赖关系,将能够实现稳定而准确的美国全国及州级预测。
引用
@article{arxiv.2106.12160,
title = {COVID-19 Forecasts Using Internet Search Information in the United States},
author = {Simin Ma and Shihao Yang},
journal= {arXiv preprint arXiv:2106.12160},
year = {2021}
}
备注
17 page, 3 figures