中文

利用章节级命名实体与注意力模型改进 ICD 编码

计算与语言 2024-07-25 v1 人工智能

摘要

近期自然语言处理(NLP)的进展推动了该领域在多个方面的自动化。然而,临床 NLP 常依赖反映真实场景不够准确的基准数据集。自动 ICD 编码作为一种关键 NLP 任务,通常使用已过时的不平衡数据集(如 MIMIC-III),现有方法因误报率较高,仅能获得 0.4 到 0.7 之间的微平均 F1 分数。我们的研究引入了改进版 ICD 编码方法,利用章节级命名实体和注意力模型提升 F1 分数。该方法将出院总结按 ICD-9 章节进行分类,并开发针对各章节数据的注意力模型,无需依赖外部数据即可完成编码识别。对于分类,采用第 IV 章进行去偏和加权,影响关键实体及权重,无需神经网络即可构建准确阈值,为人工验证提供可解释性。验证后,我们针对第 IV 章中三个常见代码和三个非常见代码开发注意力模型,使用带注意力机制的双向门控循环单元(GRU)和多头注意力 Transformer 架构。这些模型分别实现了 0.79 和 0.81 的平均微平均 F1 分数,显著提升了 ICD 编码的性能。

关键词

引用

@article{arxiv.2407.17230,
  title  = {Improving ICD coding using Chapter based Named Entities and Attentional Models},
  author = {Abhijith R. Beeravolu and Mirjam Jonkman and Sami Azam and Friso De Boer},
  journal= {arXiv preprint arXiv:2407.17230},
  year   = {2024}
}

备注

10 Pages