中文

BioBridge:代码切换电子病历中桥接模态的统一生物嵌入

计算与语言 2024-12-17 v1 人工智能

摘要

儿科急诊科(PED)过度拥挤是一个重大的全球性挑战,促使需要高效的解决方案。本文介绍了BioBridge框架,这是一种新颖的方法,将自然语言处理(NLP)应用于书面自由文本形式的电子病历(EMR),以增强PED中的决策。在非英语国家,如韩国,EMR数据通常以代码切换(CS)格式编写,混合了母语和英语,大多数代码切换的英语单词具有临床意义。BioBridge框架由两个核心模块组成:“上下文中的桥接模态”和“统一生物嵌入”。“上下文中的桥接模态”模块提高了双语和代码切换EMR的上下文理解。在“统一生物嵌入”模块中,将在医学领域训练的模型知识注入到基于编码器的模型中,以弥合医学领域和通用领域之间的差距。实验结果表明,所提出的BioBridge在多个指标上显著优于传统的机器学习和预训练的基于编码器的模型,包括F1分数、接收者操作特征曲线下面积(AUROC)、精确率-召回率曲线下面积(AUPRC)和Brier分数。具体来说,BioBridge-XLM在F1分数上提高了0.85%,AUROC提高了0.75%,AUPRC提高了0.76%,同时Brier分数显著降低了3.04%,表明与基线XLM模型相比,在准确性、可靠性和预测校准方面有了显著改进。源代码将公开提供。

关键词

引用

@article{arxiv.2412.11671,
  title  = {BioBridge: Unified Bio-Embedding with Bridging Modality in Code-Switched EMR},
  author = {Jangyeong Jeon and Sangyeon Cho and Dongjoon Lee and Changhee Lee and Junyeong Kim},
  journal= {arXiv preprint arXiv:2412.11671},
  year   = {2024}
}

备注

Accepted at IEEE Access 2024