中文

DeepDeath:利用大数据学习预测潜在死因

计算与语言 2017-05-11 v1 机器学习 机器学习

摘要

多重死因数据提供了有价值的信息来源,可通过预测人口众多社会中的健康相关轨迹来提升健康标准。这些数据通常在美国各州以海量形式存在,需要运用大数据技术来揭示复杂的隐藏模式。我们设计了两类适用于死亡率数据大规模分析的模型:基于 Hadoop 的在 N-grams 上训练的随机森林集成,以及 DeepDeath——一个基于循环神经网络(RNN)的深度分类器。我们将这两类模型应用于国家卫生统计中心提供的死亡率数据,结果表明,尽管两者的表现均显著优于随机分类器,但利用长短期记忆网络(LSTMs)的深度模型超越了基于 N-gram 的模型,并且无需构建特定的、专家驱动的特征即可学习数据的时间特性。

关键词

引用

@article{arxiv.1705.03508,
  title  = {DeepDeath: Learning to Predict the Underlying Cause of Death with Big Data},
  author = {Hamid Reza Hassanzadeh and Ying Sha and May D. Wang},
  journal= {arXiv preprint arXiv:1705.03508},
  year   = {2017}
}