临床病历的文本片段着色
计算与语言
2021-01-28 v1 机器学习
摘要
本文提出一种基于深度学习的方法,以识别临床病历中对应于ICD-9宽泛类别的片段,并进一步针对17个ICD-9类别进行颜色编码。所提医疗片段着色器(MSC)架构是一个三阶段流水线框架:(1)词分类,(2)短语分配,(3)文档分类。MSC使用门控循环单元神经网络(GRU)从输入文档映射至词多标签再至短语分配,并使用统计中位数将短语分配映射至文档多标签。我们通过重叠短语分配概率计算变长片段着色。这些跨层双向上下文链接识别自适应上下文并进而产生片段着色。我们使用文档标注的MIMIC-III临床病历训练并评估MSC。训练仅使用文档多标签,无任何短语、片段或词信息。除对临床病历着色外,MSC还生成文档多标签与词标注作为副产品——基于片段着色创建ICD9类别关键词列表。MSC副产品文档多标签与以生成可解释文档多标签为目的的方法之性能比较为:微平均F1分数64%对52.4%(对比CAML方法)。对于MSC片段着色结果评估,医学从业者基于40份着色病历样本及每类50个相关词(依据词标签)的样本,独立将颜色分配至宽泛ICD9类别。该评估的二值评分中位数为83.3%,均值为63.7%。
引用
@article{arxiv.2101.11477,
title = {Medical Segment Coloring of Clinical Notes},
author = {Maha Alkhairy},
journal= {arXiv preprint arXiv:2101.11477},
year = {2021}
}
备注
11 pages, 5 figures