中文

多模态医学代码标记器

计算与语言 2025-07-01 v3 人工智能 机器学习

摘要

在患者电子健康记录(EHR)上训练的基础模型需要将医学数据标记为离散词汇项的序列。现有标记器将EHR中的医学代码视为孤立的文本标记。然而,每个医学代码由其文本描述、其在本体层次结构中的位置以及与其他代码的关系(如疾病共发生和药物-治疗关联)所定义。医学词汇表包含超过60万个代码,这些代码对临床推理具有关键信息。我们引入MedTok,一种多模态医学代码标记器,该标记器利用代码的文本描述和关系上下文。MedTok使用语言模型编码器处理文本,并使用图编码器编码关系结构。随后将两种模态量化到统一的标记空间,以保留模态特定信息和跨模态信息。我们将MedTok集成到五个EHR模型中,并在包括住院和门诊数据集上的操作和临床任务中进行评估,包括结局预测、诊断分类、药物推荐和风险分层。用MedTok替换标准EHR标记器,在MIMIC-III上提高AUPRC 4.10%,在MIMIC-IV上提高4.78%,在EHRShot上提高11.32%,在药物推荐任务中获得最大提升。除了EHR建模,我们还演示了将MedTok标记器与医学问答系统一起使用的效果。我们的结果表明,MedTok作为医学代码的统一标记器具有潜力,可提升医学基础模型的标记化效果。

关键词

引用

@article{arxiv.2502.04397,
  title  = {Multimodal Medical Code Tokenizer},
  author = {Xiaorui Su and Shvat Messica and Yepeng Huang and Ruth Johnson and Lukas Fesser and Shanghua Gao and Faryad Sahneh and Marinka Zitnik},
  journal= {arXiv preprint arXiv:2502.04397},
  year   = {2025}
}

备注

ICML'25