中文

利用维基百科进行全球疾病监测与预测

社会与信息网络 2015-04-03 v2 机器学习 物理与社会

摘要

传染病是公共卫生、经济稳定和其他关键社会结构的主要威胁。减轻这些影响的努力依赖于准确和及时的监测来评估疾病的风险和进展。传统的以生物学为重点的监测技术准确但昂贵且缓慢;因此,基于社交媒体和搜索查询等社交互联网数据的新技术正在兴起。这些努力很有前景,但在科学同行评审、疾病和国家广度以及预测方面的重要挑战阻碍了它们的实际应用。我们检查了一个免费可用的开放数据源:在线百科全书维基百科的访问日志。使用线性模型、语言作为位置的代理以及系统而简单的文章选择程序,我们测试了14个位置-疾病组合,并证明这些数据可行地支持一种克服这些挑战的方法。具体来说,我们的概念验证产生了r2r^2高达0.92的模型,预测价值高达测试的28天,以及几对足够相似的模型,表明将模型从一个位置转移到另一个位置而无需重新训练是可行的。基于这些初步结果,我们以一个研究议程结束,旨在克服这些挑战,并产生一个比当前最先进技术更有效、更稳健和全球更全面的疾病监测和预测系统。

关键词

引用

@article{arxiv.1405.3612,
  title  = {Global disease monitoring and forecasting with Wikipedia},
  author = {Nicholas Generous and Geoffrey Fairchild and Alina Deshpande and Sara Y. Del Valle and Reid Priedhorsky},
  journal= {arXiv preprint arXiv:1405.3612},
  year   = {2015}
}

备注

27 pages; 4 figures; 4 tables. Version 2: Cite McIver & Brownstein and adjust novelty claims accordingly; revise title; various revisions for clarity