统一医学视觉语言专长:通过多-CLIP 知识蒸馏构建通用基础模型
计算机视觉与模式识别
2025-07-01 v1 人工智能
摘要
CLIP 模型在自然图像上使用十亿级图像-文本对进行预训练,已在零样态分类、跨模态检索和开放式视觉问答方面展现出惊人的能力。然而,将这一成功迁移到医学领域受到了制约:医学图像-文本语料规模不足、图像模态异构且跨机构数据标准碎片化。这些限制阻碍了从头构建统一且可泛化的医学基础模型。为此,我们引入 MMKD-CLIP,通过多-CLIP 知识蒸馏开发的通用医学基础模型。不依赖十亿级原始数据,MMKD-CLIP 从九个领域特定或通用医学 CLIP 模型(每个模型均在数百万医学图像-文本对上进行预训练)蒸馏知识。我们的两阶段训练管道首先在来自 26 种图像模态的 290 万张医学图像-文本对上进行 CLIP 风格预训练,随后使用从教师模型中提取的 1920 万对特征对进行特征级蒸馏。我们在 58 个多样化医学数据集上评估了 MMKD-CLIP,涵盖 1080 万张医学图像,跨越九种图像模态。评估范围包括六类核心任务:零样态分类、线性探测、跨模态检索、视觉问答、生存预测和癌症诊断。MMKD-CLIP 在所有教师模型中均表现出优异,同时在不同图像域和任务设置下展现出惊人的鲁棒性和泛化能力。这一结果表明,在现实数据可得性的实际限制下,多教师知识蒸馏是构建高性能医学基础模型的可扩展且有效的方法。
引用
@article{arxiv.2506.22567,
title = {Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation},
author = {Shansong Wang and Zhecheng Jin and Mingzhe Hu and Mojtaba Safari and Feng Zhao and Chih-Wei Chang and Richard LJ Qiu and Justin Roper and David S. Yu and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2506.22567},
year = {2025}
}