UniMed-CLIP:面向多模态医学影像的统一图像-文本预训练范式
计算机视觉与模式识别
2024-12-16 v1
摘要
通过对比学习训练的视觉-语言模型(VLM)在自然图像任务中取得了显著的成功。然而,其在医学领域的应用仍受限于公开可获取的大规模医学图像-文本数据稀缺。现有的医学VLM要么在封闭来源的专有数据或规模较小的开源数据上训练,这些数据不利于泛化;要么大多数模型仅限于单一或有限数量的医学影像领域,从而限制了其对其他模态的适用性。为此,我们引入UniMed,一个规模庞大的开源多模态医学数据集,涵盖超过530万张图像-文本对,覆盖六种多样化的医学影像模态:X光、CT、MRI、超声、病理和眼底。UniMed采用大型语言模型(LLM)将特定模态的分类数据集转换为图像-文本格式的框架开发,同时整合了医学领域现有的图像-文本数据,促进了可扩展的VLM预训练。基于UniMed,我们训练了UniMed-CLIP——一个适用于六种模态的统一VLM,显著优于现有的通用VLM,并与专门针对各模态的医学VLM相当,在零样例评估中取得显著提升。例如,UniMed-CLIP在21个数据集上的平均准确率提升了12.61分(相对于BiomedCLIP,该模型使用的是专有数据),同时仅使用了其训练数据的3倍。为促进未来研究,我们将UniMed数据集、训练代码和模型均发布于https://github.com/mbzuai-oryx/UniMed-CLIP。
引用
@article{arxiv.2412.10372,
title = {UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities},
author = {Muhammad Uzair Khattak and Shahina Kunhimon and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2412.10372},
year = {2024}
}
备注
Code, models and demo available at https://github.com/mbzuai-oryx/UniMed-CLIP