中文

MEDBind:统一的医疗数据嵌入表示

计算机视觉与模式识别 2024-03-21 v2

摘要

医学视觉语言预训练模型 (VLPM) 在将胸片 X 光 (CXR) 与临床文本融合方面取得了显著进展,引入了图像-文本数据绑定方法,使其能够实现零样本学习和下游临床任务。然而,当前的研究缺乏对其他医疗模态数据(如心电图 (ECG))的全面集成。我们提出了 MEDBind (Medical Electronic patient recorD),通过文本数据作为中心锚点,实现了 CXR、ECG 和医疗文本之间的联合嵌入。MEDBind 采用三模态绑定方式,在顶部-K 检索、零样本和少样本基准测试中均表现出竞争力,同时支持 CXR 到 ECG 的零样本分类和检索。这种无缝集成通过对模态-文本对采用对比损失,并引入我们提出的 Edge-Modality 对比损失函数实现,构建了 CXR、ECG 和文本的统一嵌入空间。最后,我们展示了 MEDBind 能够通过直接将 CXR 和 ECG 嵌入集成到大型语言模型中进行多模态提示调优,从而提升下游任务性能。

关键词

引用

@article{arxiv.2403.12894,
  title  = {MEDBind: Unifying Language and Multimodal Medical Data Embeddings},
  author = {Yuan Gao and Sangwook Kim and David E Austin and Chris McIntosh},
  journal= {arXiv preprint arXiv:2403.12894},
  year   = {2024}
}