中文

利用笔记文本进行预测:使用 word2vec 构建合成特征

计算与语言 2015-03-18 v1

摘要

word2vec 提供了一种简单而强大的方法,用于从非结构化文本数据中提取定量变量。超过一半的医疗数据是非结构化的,因此若无数据工程和自然语言处理方面的专业知识则难以建模。word2vec 可以作为桥梁,快速从此类数据源中获取情报。在本研究中,我们将来自 Providence Health & Services 电子病历的 650 MB 非结构化医疗图表笔记通过 word2vec 进行处理。我们采用了两种不同的方法创建预测变量,并在慢性阻塞性肺病 (COPD) 患者的再入院风险上进行了测试。作为对比基准,我们使用 LACE 风险模型(基于住院时间、急症程度、合并症和急诊就诊次数的单一评分)运行了相同的测试。仅利用自由文本和数学能力,我们发现 word2vec 在预测 COPD 患者再入院风险方面与 LACE 相当。

关键词

引用

@article{arxiv.1503.05123,
  title  = {Prediction Using Note Text: Synthetic Feature Creation with word2vec},
  author = {Manuel Amunategui and Tristan Markwell and Yelena Rozenfeld},
  journal= {arXiv preprint arXiv:1503.05123},
  year   = {2015}
}

备注

13 pages including appendix