基于多滤波器残差卷积神经网络的临床文本 ICD 编码
计算与语言
2019-12-03 v1 机器学习
摘要
自动化 ICD 编码将国际疾病分类代码分配给患者就诊记录,因可节省计费的时间和人力而受到大量研究关注。先前的最先进模型利用一个卷积层构建文档表示以预测 ICD 代码。然而,与 ICD 编码密切相关的文本片段的长度和语法在不同文档中差异很大。因此,扁平且固定长度的卷积架构可能无法学习到良好的文档表示。本文中,我们提出了一种用于 ICD 编码的多滤波器残差卷积神经网络(MultiResCNN)。我们模型的创新有两点:利用多滤波器卷积层捕获不同长度的各种文本模式,以及利用残差卷积层扩大感受野。我们在广泛使用的 MIMIC 数据集上评估了模型的有效性。在 MIMIC-III 的完整代码集上,我们的模型在 6 个评价指标中的 4 个上优于最先进模型。在 MIMIC-III 的前 50 代码集和 MIMIC-II 的完整代码集上,我们的模型在所有评价指标上均优于所有已有及最先进模型。代码可在 https://github.com/foxlf823/Multi-Filter-Residual-Convolutional-Neural-Network 获取。
引用
@article{arxiv.1912.00862,
title = {ICD Coding from Clinical Text Using Multi-Filter Residual Convolutional Neural Network},
author = {Fei Li and Hong Yu},
journal= {arXiv preprint arXiv:1912.00862},
year = {2019}
}