中文

建模诊断标签相关性以实现自动ICD编码

计算与语言 2021-06-25 v1

摘要

给定电子健康记录(EHRs)中书写的临床笔记,预测诊断代码是一项困难的任务,其被形式化为多标签分类问题。庞大的标签集合、层级依赖关系以及数据不平衡使得该预测任务极为困难。大多数现有工作为每个标签独立构建二分类预测,忽略了标签之间的依赖关系。为解决此问题,我们提出一个两阶段框架,通过捕捉标签相关性来改进自动 ICD 编码。具体而言,我们训练一个标签集分布估计器,对基预测器生成的每个标签集候选的概率进行重打分。本文首次尝试将标签集分布的学习作为医学代码预测的重排序模块。在实验中,我们提出的框架能够在基准 MIMIC 数据集上改进最佳性能预测器。本项目的源代码可在 https://github.com/MiuLab/ICD-Correlation 获取。

关键词

引用

@article{arxiv.2106.12800,
  title  = {Modeling Diagnostic Label Correlation for Automatic ICD Coding},
  author = {Shang-Chi Tsai and Chao-Wei Huang and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2106.12800},
  year   = {2021}
}

备注

NAACL 2021 Long Paper. Code available at https://github.com/MiuLab/ICD-Correlation