多模态掩码同义网络提升胸部X光表征学习
计算机视觉与模式识别
2024-10-01 v1 人工智能
机器学习
摘要
自监督学习方法在医学图像中主要依赖单一成像模态进行预训练。虽然这些方法已显示出有前景的效果,但未充分利用电子健康记录(EHR)中收集的患者信息或扫描信息。本研究提出在自监督预训练中融合EHR数据,采用掩码同义网络(MSN)来提高胸部X光表征的质量。我们研究了三类EHR数据,包括人口学信息、扫描元数据和住院信息。我们在三个公开可用的胸部X光数据集上进行评估,分别是MIMIC-CXR、CheXpert和NIH-14,同时使用两种视觉Transformer(ViT)作为 backbone,分别为ViT-Tiny和ViT-Small。在通过线性评估来评估表征质量时,我们的方法相较于基础MSN和最先进的自监督学习基线显著改进。我们的工作凸显了EHR增强自监督预训练在医学影像中的潜力。代码已公开发布:https://github.com/nyuad-cai/CXR-EHR-MSN
引用
@article{arxiv.2407.04449,
title = {Multi-modal Masked Siamese Network Improves Chest X-Ray Representation Learning},
author = {Saeed Shurrab and Alejandro Guerra-Manzanares and Farah E. Shamout},
journal= {arXiv preprint arXiv:2407.04449},
year = {2024}
}
备注
Under review