中文

将多标签少样本 ICD 编码作为带提示的自回归生成

计算与语言 2022-11-30 v2 人工智能

摘要

自动国际疾病分类(ICD)编码旨在为平均 3,000+ token 的医学记录分配多个 ICD 代码。该任务因多标签分配的高维空间(155,000+ ICD 代码候选)及长尾挑战——许多 ICD 代码极少被赋值但临床意义重大——而颇具难度。本研究通过将这一多标签分类任务转化为自回归生成任务来应对长尾挑战。具体而言,我们首先引入一种新颖的预训练目标,利用医师记录所用的医学逻辑 SOAP 结构生成自由文本诊断与操作。其次,我们的模型不直接预测高维 ICD 代码空间,而是生成维度较低文本描述,再由其推断 ICD 代码。第三,我们为多标签分类设计了新颖提示模板。我们在全代码分配基准(MIMIC-III-full)与少样本 ICD 代码分配评测基准(MIMIC-III-few)上评估所提带提示生成模型。MIMIC-III-few 上的实验显示,我们的模型 macro F1 达 30.2,大幅优于此前的 MIMIC-III-full SOTA 模型(macro F1 4.3)及专为少/零样本设定设计的模型(macro F1 18.7)。最后,我们设计了一种新颖集成学习器——带提示的跨注意力重排序器,以融合先前 SOTA 与我们所获最佳少样本编码预测。MIMIC-III-full 上的实验表明,该集成学习器使 macro 与 micro F1 分别从 10.4 提升至 14.6、从 58.2 提升至 59.1。

关键词

引用

@article{arxiv.2211.13813,
  title  = {Multi-label Few-shot ICD Coding as Autoregressive Generation with Prompt},
  author = {Zhichao Yang and Sunjae Kwon and Zonghai Yao and Hong Yu},
  journal= {arXiv preprint arXiv:2211.13813},
  year   = {2022}
}

备注

To be appear in AAAI2023