利用笔记文本进行预测:使用 word2vec 构建合成特征
计算与语言
2015-03-18 v1
摘要
word2vec 提供了一种简单而强大的方法,用于从非结构化文本数据中提取定量变量。超过一半的医疗数据是非结构化的,因此若无数据工程和自然语言处理方面的专业知识则难以建模。word2vec 可以作为桥梁,快速从此类数据源中获取情报。在本研究中,我们将来自 Providence Health & Services 电子病历的 650 MB 非结构化医疗图表笔记通过 word2vec 进行处理。我们采用了两种不同的方法创建预测变量,并在慢性阻塞性肺病 (COPD) 患者的再入院风险上进行了测试。作为对比基准,我们使用 LACE 风险模型(基于住院时间、急症程度、合并症和急诊就诊次数的单一评分)运行了相同的测试。仅利用自由文本和数学能力,我们发现 word2vec 在预测 COPD 患者再入院风险方面与 LACE 相当。
引用
@article{arxiv.1503.05123,
title = {Prediction Using Note Text: Synthetic Feature Creation with word2vec},
author = {Manuel Amunategui and Tristan Markwell and Yelena Rozenfeld},
journal= {arXiv preprint arXiv:1503.05123},
year = {2015}
}
备注
13 pages including appendix