基于图神经网络联合嵌入临床编码与文本的多视图学习框架
计算与语言
2023-01-30 v1 人工智能
摘要
学习表示自由文本是许多临床机器学习(ML)应用中的核心任务,因为临床文本包含无法从其他途径获得用于推断的观察与计划。最先进的方法使用以巨大计算资源和训练数据开发的大语言模型;然而,由于临床自由文本中句法与词汇的高度多变,应用这些模型颇具挑战。诸如国际疾病分类(ICD)编码之类的结构化信息通常简洁地抽象出临床就诊的最重要事实并取得良好性能,但在真实场景中往往不如临床文本那样易得。我们提出了一种\textbf{多视图学习框架},该框架联合从编码与文本中学习,以结合文本的可获得性与前瞻性本质以及 ICD 编码的更优性能。所学得的文本嵌入可在推断时作为预测算法的输入,而无需依赖 ICD 编码。我们的方法使用图神经网络(GNN)处理 ICD 编码,并使用 Bi-LSTM 处理文本。我们应用深度典型相关分析(DCCA)来强制两个视图学习每位患者的相似表示。在使用计划外科手术文本进行的实验中,我们的模型优于针对临床数据微调的 BERT 模型;在使用 MIMIC-III 中多样化文本进行的实验中,我们的模型以极小的计算代价与微调后的 BERT 相当。
引用
@article{arxiv.2301.11608,
title = {A Multi-View Joint Learning Framework for Embedding Clinical Codes and Text Using Graph Neural Networks},
author = {Lecheng Kong and Christopher King and Bradley Fritz and Yixin Chen},
journal= {arXiv preprint arXiv:2301.11608},
year = {2023}
}