DeepDeath:利用大数据学习预测潜在死因
计算与语言
2017-05-11 v1 机器学习
机器学习
摘要
多重死因数据提供了有价值的信息来源,可通过预测人口众多社会中的健康相关轨迹来提升健康标准。这些数据通常在美国各州以海量形式存在,需要运用大数据技术来揭示复杂的隐藏模式。我们设计了两类适用于死亡率数据大规模分析的模型:基于 Hadoop 的在 N-grams 上训练的随机森林集成,以及 DeepDeath——一个基于循环神经网络(RNN)的深度分类器。我们将这两类模型应用于国家卫生统计中心提供的死亡率数据,结果表明,尽管两者的表现均显著优于随机分类器,但利用长短期记忆网络(LSTMs)的深度模型超越了基于 N-gram 的模型,并且无需构建特定的、专家驱动的特征即可学习数据的时间特性。
引用
@article{arxiv.1705.03508,
title = {DeepDeath: Learning to Predict the Underlying Cause of Death with Big Data},
author = {Hamid Reza Hassanzadeh and Ying Sha and May D. Wang},
journal= {arXiv preprint arXiv:1705.03508},
year = {2017}
}