基于循环神经网络的主诉分类
机器学习
2018-07-13 v2 机器学习
摘要
综合征监测通过急诊科记录等来源检测和监控个体与人群健康指标。对这些记录的自动分类可提高暴发检测速度和诊断准确性。当前的综合征系统依赖基于手工编码关键词的方法解析文本字段,并可能受益于现代监督学习分类器模型的使用。本文实现两种基于长短期记忆(LSTM)和门控循环单元(GRU)的循环神经网络模型,并将其与两种传统的词袋分类器进行比较:多项朴素贝叶斯(MNB)和支持向量机(SVM)。MNB分类器是目前仅有的两种用于综合征监测的机器学习算法之一。所有四个模型均训练用于预测临床分类软件定义的诊断代码组,先根据出院诊断预测,再根据主诉字段预测。分类器在来自美国单一辖区的360万条去标识化急诊科记录上训练。我们主要使用F1分数比较这些模型的性能。使用出院诊断时,LSTM分类器表现最佳,尽管所有模型的F1分数均高于96.00。GRU在主诉上表现最佳(F1=47.38),而带二元文法的MNB表现最差(F1=39.40)。某些综合征类型比其他类型更易检测。例如,使用GRU模型的主诉对酒精相关疾病预测良好(F1=78.91),但对流感预测较差(F1=14.80)。在所有情况下,RNN模型均优于词袋分类器,表明深度学习模型可大幅改善综合征监测中非结构化文本的自动分类。
引用
@article{arxiv.1805.07574,
title = {Chief complaint classification with recurrent neural networks},
author = {Scott H Lee and Drew Levin and Pat Finley and Charles M Heilig},
journal= {arXiv preprint arXiv:1805.07574},
year = {2018}
}