利用搜索引擎、社交网络、在线购物、问答服务及既往流感患者数据进行流感监测
计算机与社会
2021-04-15 v1
摘要
流感是一种传染病,在全球范围内造成大量死亡。在流行期间预测流感患病人数对于临床、医院和社区疫情准备是一项重要任务。在线用户生成内容 (UGC),主要以社交媒体帖子或搜索查询日志的形式,通常被用于预测对突发和异常疫情的响应。然而,大多数研究仅依赖 UGC 作为资源,并未使用多种 UGC。我们的研究旨在解决有关流感预测的这些问题:哪种模型最好?多种 UGC 的何种组合效果良好?每种 UGC 的性质是什么?我们采用若干模型——LASSO 回归、Huber 回归、带线性核的支持向量机回归 (SVR) 和随机森林——来测试 2015–2018 年日本流感数量的预测。为此,我们使用五种在线数据资源:(1) 既往流感患者,(2) 社交网络 (Twitter),(3) 搜索引擎 (Yahoo! Japan),(4) 购物服务 (Yahoo! Shopping),以及 (5) 问答服务 (Yahoo! Chiebukuro) 作为各模型的资源。然后,我们使用最佳模型 Huber 回归,在剔除某一种资源的情况下分别验证各资源的贡献。最后,我们使用贝叶斯变点方法来确定任何资源的时间序列趋势是否反映在流感患者数量的趋势中。我们的实验表明,基于多种数据资源的 Huber 回归模型产生了最准确的结果。进而,从变点分析我们得到结果:三年的搜索查询日志和社交媒体帖子表明这些资源是良好的预测因子。结论:我们表明基于多种数据资源的 Huber 回归对离群值具有鲁棒性,适用于流感预测。此外,我们指出了每种资源在流感预测中的特征。
引用
@article{arxiv.2104.06646,
title = {Influenza Surveillance using Search Engine, SNS, On-line Shopping, Q&A Service and Past Flu Patients},
author = {Taichi Murayama and Nobuyuki Shimizu and Sumio Fujita and Shoko Wakamiya and Eiji Aramaki},
journal= {arXiv preprint arXiv:2104.06646},
year = {2021}
}
备注
18pages, 3 figures