中文

MDACE:带有编码证据的 MIMIC 文档数据集

计算与语言 2023-07-11 v1

摘要

我们针对长医疗文档上的极端多标签分类任务,引入了一个用于证据/依据抽取的数据集。其中一项此类任务是计算机辅助编码(CAC),近年来由于机器学习技术的进步,其性能已有显著提升。然而,仅预测患者就诊的一组最终编码是不够的,因为 CAC 系统需要提供支撑性的文本证据来佐证计费编码。一个能够为每个编码生成准确且可靠支撑证据的模型将带来巨大益处。然而,人工标注的编码证据语料库极难创建,因为这需要专业知识。在本文中,我们介绍了首个公开可用的编码证据数据集 MDACE,它构建于 MIMIC-III 临床记录的子集之上。该数据集由专业医学编码员标注,包含 302 份住院病历(含 3,934 个证据片段)和 52 份 Profee 病历(含 5,563 个证据片段)。我们基于 EffectiveCAN 模型(Liu et al., 2021)实现了若干证据抽取方法,以在该数据集上建立基线性能。MDACE 可用于评估 CAC 系统的编码证据抽取方法,以及深度学习模型在多标签分类中的准确率和可解释性。我们相信 MDACE 的发布将极大促进对深度学习技术在医疗编码和文档分类中理解与应用的提升。

关键词

引用

@article{arxiv.2307.03859,
  title  = {MDACE: MIMIC Documents Annotated with Code Evidence},
  author = {Hua Cheng and Rana Jafari and April Russell and Russell Klopfer and Edmond Lu and Benjamin Striner and Matthew R. Gormley},
  journal= {arXiv preprint arXiv:2307.03859},
  year   = {2023}
}