基于神经网络处理 MIMIC-III 临床笔记以识别诊断与操作的自然语言处理
计算与语言
2020-01-01 v1 机器学习
摘要
医疗记录中的诊断与操作编码是医疗行业的关键流程,包括生成准确账单、从支付方获得报销以及创建标准化患者诊疗记录。在美国,2012 年账单与保险相关活动花费约 4710 亿美元,约占美国医院总支出的 25%。本文中,我们报告了一个自然语言处理模型的性能,该模型可将临床笔记映射至医疗编码,并从现病史、入院时症状等非结构化记录中预测最终诊断。既往研究表明,相较于传统机器学习模型,深度学习模型在此类映射上表现更优。因此,我们在最大的急诊科临床笔记数据集 MIMIC III(含 120 万条临床笔记)上采用最先进的深度学习方法 ULMFiT,以筛选前 10 与前 50 的诊断与操作编码。我们的模型预测前 10 诊断与操作的准确率分别为 80.3% 与 80.5%,而前 50 的 ICD-9 诊断与操作编码预测准确率分别为 70.7% 与 63.9%。从非结构化临床笔记预测诊断与操作有助于人工编码员节省时间、消除错误并降低成本。鉴于本模型取得的可观分数,下一步将在小规模真实场景中部署并与作为金标准的人工编码员比较。我们相信该方法的进一步研究可创建高准确度预测,从而简化临床环境工作流。
引用
@article{arxiv.1912.12397,
title = {Natural language processing of MIMIC-III clinical notes for identifying diagnosis and procedures with neural networks},
author = {Siddhartha Nuthakki and Sunil Neela and Judy W. Gichoya and Saptarshi Purkayastha},
journal= {arXiv preprint arXiv:1912.12397},
year = {2020}
}
备注
This is a shortened version of the Capstone Project that was accepted by the Faculty of Indiana University, in partial fulfillment of the requirements for the degree of Master of Science in Health Informatics in Dec 2018