基于图对比学习的少样本电子健康记录编码
人工智能
2021-06-30 v1 计算与语言
摘要
电子健康记录(EHR)编码是为每份 EHR 分配 ICD 编码的任务。以往研究大多仅关注高频 ICD 编码,或将罕见与高频 ICD 编码同等对待。这些方法在高频 ICD 编码上表现良好,但由于 ICD 编码分布极不均衡,其在罕见编码上的表现远不能令人满意。我们旨在通过一种基于对比图的 EHR 编码框架 CoGraph 来提升高频与罕见 ICD 编码的性能,该框架将 EHR 编码重定义为少样本学习任务。首先,我们为每份 EHR 构建异质 EHR 词-实体(HEWE)图,其中从 EHR 提取的词与实体作为节点,它们之间的关系作为边。随后,CoGraph 学习来自不同 ICD 编码的 HEWE 图之间的相似与不相似关系,从而实现信息在它们之间的迁移。在少样本学习场景下,模型在训练时仅能接触高频 ICD 编码,这可能迫使其仅编码对高频 ICD 编码有用的特征。为缓解此风险,CoGraph 设计了两种图对比学习方案 GSCL 与 GECL,利用 HEWE 图结构以编码可迁移特征。GSCL 利用从 HEWE 图采样的不同子图间的内在关联,而 GECL 利用不同临床阶段 HEWE 图之间的相互关联。在 MIMIC-III 基准数据集上的实验表明,CoGraph 在多项评价指标上显著优于最先进(SOTA)的 EHR 编码方法,不仅在高频 ICD 编码上,也在罕见编码上。在高频 ICD 编码上,GSCL 与 GECL 分别将分类准确率与 F1 提升 1.31% 与 0.61%;在罕见 ICD 编码上 CoGraph 提升更为明显,达 2.12% 与 2.95%。
引用
@article{arxiv.2106.15467,
title = {Few-Shot Electronic Health Record Coding through Graph Contrastive Learning},
author = {Shanshan Wang and Pengjie Ren and Zhumin Chen and Zhaochun Ren and Huasheng Liang and Qiang Yan and Evangelos Kanoulas and Maarten de Rijke},
journal= {arXiv preprint arXiv:2106.15467},
year = {2021}
}