中文

基于知识注入提示微调的多标签少样本 ICD 编码

计算与语言 2022-10-14 v2

摘要

自动国际疾病分类(ICD)编码旨在为平均长度 3,000+ token 的医疗记录分配多个 ICD 代码。该任务具有挑战性,原因在于多标签分配的高维空间(数万种 ICD 代码)以及长尾问题:仅少数代码(常见疾病)被频繁分配,而大多数代码(罕见疾病)被分配的频率很低。本研究通过采用带有标签语义的基于提示的微调技术来应对长尾问题,该技术已在少样本设定下被证明有效。为了进一步提升在医疗领域的性能,我们提出了一种知识增强的 longformer,通过对比学习附加预训练注入三种领域特定知识:层级、同义词和缩写。在代码分配的基准数据集 MIMIC-III-full 上的实验表明,我们提出的方法在 marco F1 上比先前最先进(SOTA)方法提升 14.5%(从 10.3 到 11.8,P<0.001)。为了进一步在少样本设定下测试我们的模型,我们创建了一个新的罕见疾病编码数据集 MIMIC-III-rare50,在该数据集上我们的模型相比先前方法将 marco F1 从 17.1 提升至 30.4,micro F1 从 17.2 提升至 32.6。

关键词

引用

@article{arxiv.2210.03304,
  title  = {Knowledge Injected Prompt Based Fine-tuning for Multi-label Few-shot ICD Coding},
  author = {Zhichao Yang and Shufan Wang and Bhanu Pratap Singh Rawat and Avijit Mitra and Hong Yu},
  journal= {arXiv preprint arXiv:2210.03304},
  year   = {2022}
}

备注

Accepted by Findings of EMNLP 2022, code is available at https://github.com/whaleloops/KEPT