MoRE:基于X光、心电图和诊断报告的变换器多模态对比预训练
人工智能
2024-10-24 v2 计算机视觉与模式识别
机器学习
摘要
本文提出一种新型多模态对比预训练框架,将X光、心电图(ECG)和放射学/心脏学报告有效融合。我们的方案利用变换器对这些不同模态进行编码,构建统一的表示空间,以提升诊断准确性并促进全面患者评估。我们采用LoRA-Peft显著降低LLM中的可训练参数,并在视觉变换器(ViT)中引入最新的线性注意力丢弃策略以实现更平滑的注意力。此外,我们提供新的多模态注意力解释和检索功能。迄今为止,我们是首次提出一种集成X光、ECG和放射学/心脏学报告的模型。通过利用对比损失,MoRE有效地将各模态特色对齐到连贯的嵌入中,从而支持各种下游任务,如零样本分类和多模态检索。采用我们提出的方法,我们在Mimic-IV、CheXpert、Edema Severity和PtbXl等下游数据集上实现了最先进(SOTA)水平,超越了现有的多模态方法。我们提出的框架在捕捉复杂跨模态关系方面显著提升,并在医疗诊断中展现出良好的鲁棒性,为医疗保健领域多模态学习的未来研究奠定了框架。
引用
@article{arxiv.2410.16239,
title = {MoRE: Multi-Modal Contrastive Pre-training with Transformers on X-Rays, ECGs, and Diagnostic Report},
author = {Samrajya Thapa and Koushik Howlader and Subhankar Bhattacharjee and Wei le},
journal= {arXiv preprint arXiv:2410.16239},
year = {2024}
}
备注
10 pages, 5 figures, 9 tables. Supplementary detail in Appendix. Code made available in Github for reproducibility