中文

Mimic-IV-ICD:面向极端多标签分类的新基准

人工智能 2023-04-28 v1

摘要

临床笔记会被分配 ICD 编码,即用于诊断和操作的编码集。近年来,人们构建了预测机器学习模型以实现自动 ICD 编码。然而,目前缺乏基于大规模公开电子健康记录(EHR)数据的、被广泛接受的自动 ICD 编码模型基准。本文提出了一套基于 MIMIC-IV(最新公开 EHR 数据集)的大型 EHR 数据集的 ICD-10 编码公开基准套件。我们实现并比较了几种流行的 ICD 编码预测方法,以标准化数据预处理并建立全面的 ICD 编码基准数据集。这种方法促进了可复现性和模型比较,加速了未来研究中采用自动 ICD 编码的进程。此外,我们利用 MIMIC-IV 数据创建了一个新的 ICD-9 基准,提供了比 MIMIC-III 更多的数据点和更大数量的 ICD 编码。我们的开源代码为拥有 MIMIC-IV 访问权限的用户提供了对数据处理步骤、基准创建和实验复现的便捷访问,为高效开发 ICD 编码模型提供了见解、指导和协议。

关键词

引用

@article{arxiv.2304.13998,
  title  = {Mimic-IV-ICD: A new benchmark for eXtreme MultiLabel Classification},
  author = {Thanh-Tung Nguyen and Viktor Schlegel and Abhinav Kashyap and Stefan Winkler and Shao-Syuan Huang and Jie-Jyun Liu and Chih-Jen Lin},
  journal= {arXiv preprint arXiv:2304.13998},
  year   = {2023}
}

备注

Benchmark, Multilabel, Classification