Guided Deep List:从开放源自动生成流行病学个案列表
计算与语言
2017-02-23 v1 信息检索
摘要
对新发公共卫生威胁的实时监测与响应依赖于及时可用的监测数据。在疫情初期,若能随时获得包含实验室确诊病例详细表格信息的个案列表,可帮助流行病学家做出可靠的推断与预测。此类推断对于尽早了解特定疾病的流行病学特征以阻止或控制疫情至关重要。然而,构建此类个案列表需要大量人工监督,因此难以实时生成。本文中,我们提出 Guided Deep List,这是首个从新发疾病疫情的开放源报告中(近实时地)自动构建个案列表的工具。具体而言,我们专注于从疾病报告中提取新发疾病的流行病学特征及受影响人群的信息。Guided Deep List 使用分布式向量表示(类似 word2vec)为每个个案列表特征发现一组指标。在发现指标之后,再使用基于依存句法分析的技术以表格形式进行最终抽取。我们对照 HealthMap 提供的、与沙特阿拉伯 MERS 疫情相对应的人工标注个案列表,评估了 Guided Deep List 的性能。我们证明,与基线方法相比,Guided Deep List 提取个案列表特征的准确率更高。我们进一步展示了如何利用这些自动提取的个案列表特征进行流行病学推断,例如推断受影响个体的基本人口学特征以及从出现症状到住院的间隔时间。
引用
@article{arxiv.1702.06663,
title = {Guided Deep List: Automating the Generation of Epidemiological Line Lists from Open Sources},
author = {Saurav Ghosh and Prithwish Chakraborty and Bryan L. Lewis and Maimuna S. Majumder and Emily Cohn and John S. Brownstein and Madhav V. Marathe and Naren Ramakrishnan},
journal= {arXiv preprint arXiv:1702.06663},
year = {2017}
}
备注
This paper has been submitted to a conference