中文

Durkheim 项目数据分析报告

人工智能 2014-01-30 v1 计算与语言 机器学习

摘要

本报告描述了在 DARPA DCAPS 计划下与 Durkheim 项目 [http://durkheimproject.org/] 合作创建的自杀倾向预测模型。这些模型主要基于从退伍军人健康管理局(VHA)获取的数百份患者记录中的非结构化文本(自由格式的临床医生笔记)构建而成。模型是使用应用于词袋和短语袋数据集的遗传编程算法构建的。我们探索了额外结构化数据的影响,但发现其影响较小。鉴于数据集规模较小,队列之间的分类具有高保真度(98%)。交叉验证表明这些模型具有合理的预测能力,在五个轮换折叠上的准确率为 50% 至 69%,集成平均值为 58% 至 67%。一个特别值得注意的结果是,词对可以显著提高分类准确率;但这仅在词对中的一个词已知具有高预测价值时才成立。相比之下,所有可能词对的集合并未优于简单的词袋模型。

关键词

引用

@article{arxiv.1310.6775,
  title  = {Durkheim Project Data Analysis Report},
  author = {Linas Vepstas},
  journal= {arXiv preprint arXiv:1310.6775},
  year   = {2014}
}

备注

43 pages, to appear as appendix of primary science publication Poulin, et al "Predicting the risk of suicide by analyzing the text of clinical notes"