中文

MIMIC-III临床编码数据集的实验评估与银标准开发

机器学习 2023-02-28 v1 机器学习

摘要

临床编码目前是一个劳动密集型、易出错但至关重要的管理过程,在此过程中,医院患者病历由合格的工作人员从大型标准化分类编码层次结构中手动分配代码。临床编码自动化在自然语言处理研究中有着悠久的历史,并且近期出现了新的发展,取得了当前最优的结果。该任务中常用的一个数据集是MIMIC-III,这是一个包含临床自由文本笔记和相关代码的大型重症监护数据库。我们主张重新考虑MIMIC-III中分配代码的有效性,这些代码常被视为金标准,尤其是当MIMIC-III未经过二次验证时。本工作提出了一种开源、可重复的实验方法,用于评估从电子健康档案出院小结中提取的代码的有效性。我们以MIMIC-III出院小结为例展示了该方法,并显示MIMIC-III中最常分配的代码存在高达35%的编码不足。

关键词

引用

@article{arxiv.2006.07332,
  title  = {Experimental Evaluation and Development of a Silver-Standard for the MIMIC-III Clinical Coding Dataset},
  author = {Thomas Searle and Zina Ibrahim and Richard JB Dobson},
  journal= {arXiv preprint arXiv:2006.07332},
  year   = {2023}
}