中文

从巴西葡萄牙语临床笔记预测多个 ICD-10 编码

计算与语言 2020-11-18 v1 机器学习

摘要

从电子临床记录中进行 ICD 编码是一个手工、耗时且昂贵的过程。然而,编码分配对于账单目的与数据库组织是一项重要任务。尽管许多工作已研究利用机器学习技术从自由文本自动进行 ICD 编码的问题,但大多数使用英语记录,尤其是来自 MIMIC-III 公共数据集的记录。本工作展示了一个包含巴西葡萄牙语临床笔记的数据集上的结果。我们开发并优化了逻辑回归模型、卷积神经网络(CNN)、门控循环单元神经网络以及带注意力机制的 CNN(CNN-Att)用于诊断 ICD 编码的预测。我们也报告了在 MIMIC-III 数据集上的结果,其在同族模型中优于先前工作,并达到了当前最优(SOTA)。与 MIMIC-III 相比,巴西葡萄牙语数据集在仅使用出院小结时每篇文档的词数少得多。我们尝试拼接该数据集中可用的额外文档,获得了性能的大幅提升。CNN-Att 模型在两个数据集上均取得最佳结果,在 MIMIC-III 上的微平均 F1 分数为 0.537,在我们含额外文档的数据集上为 0.485。

关键词

引用

@article{arxiv.2008.01515,
  title  = {Predicting Multiple ICD-10 Codes from Brazilian-Portuguese Clinical Notes},
  author = {Arthur D. Reys and Danilo Silva and Daniel Severo and Saulo Pedro and Marcia M. de Souza e Sá and Guilherme A. C. Salgado},
  journal= {arXiv preprint arXiv:2008.01515},
  year   = {2020}
}

备注

Accepted at BRACIS 2020