从非结构化文本刻画疾病:一种词汇驱动的Word2vec方法
机器学习
2016-06-07 v2 计算与语言
机器学习
摘要
传统的疾病监测可通过新闻与社交媒体等广泛实时来源加以增强。然而,这些来源通常是非结构化的,并且分类相关性、轨迹映射等监测工具的构建涉及大量人工监督。本文提出一种疾病词汇驱动的word2vec模型(Dis2Vec),从HealthMap新闻语料中将疾病及其组成属性建模为词嵌入。我们利用这些词嵌入自动创建疾病分类体系,并与相应的人工标注分类体系进行评估比较。我们将模型准确率与若干最先进的word2vec方法进行比较。结果表明,在忠实捕捉地方型、新发型和罕见型等不同类别疾病的分类属性方面,Dis2Vec优于传统的分布式向量表示。
引用
@article{arxiv.1603.00106,
title = {Characterizing Diseases from Unstructured Text: A Vocabulary Driven Word2vec Approach},
author = {Saurav Ghosh and Prithwish Chakraborty and Emily Cohn and John S. Brownstein and Naren Ramakrishnan},
journal= {arXiv preprint arXiv:1603.00106},
year = {2016}
}
备注
this paper has been submitted to a conference