MedBLIP:从三维医学图像与文本引导语言-图像预训练
计算机视觉与模式识别
2023-05-19 v1
摘要
视觉-语言预训练(VLP)模型已被证明在许多计算机视觉应用中是有效的。在本文中,我们考虑在医学领域开发一种VLP模型,用于基于图像扫描和电子健康记录中的文本描述进行计算机辅助诊断(CAD),正如实际中所做的那样。为实现目标,我们提出了一种轻量级CAD系统MedBLIP,这是一种利用现成冻结的预训练图像编码器和冻结的大语言模型引导VLP的新范式。我们设计了MedQFormer模块,以弥合3D医学图像与2D预训练图像编码器及语言模型之间的差距。为评估MedBLIP的有效性,我们从五个公共阿尔茨海默病(AD)数据集(即ADNI、NACC、OASIS、AIBL和MIRIAD)收集了超过30,000个图像体。在我们所知的最大的AD数据集上,我们的模型在健康、轻度认知障碍(MCI)和AD受试者的零样本分类上达到了SOTA性能,并展示了其进行医学视觉问答(VQA)的能力。代码和预训练模型在线可用:https://github.com/Qybc/MedBLIP。
引用
@article{arxiv.2305.10799,
title = {MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts},
author = {Qiuhui Chen and Xinyue Hu and Zirui Wang and Yi Hong},
journal= {arXiv preprint arXiv:2305.10799},
year = {2023}
}
备注
11 pages, 3 figures