MAFM^3:面向多模态医学AI的模块化基础模型适应框架
计算机视觉与模式识别
2025-11-17 v1
摘要
基础模型是在大规模数据集上训练以捕捉领域总体趋势的模型。然而,在医学影像领域,数据稀缺使得为每个领域、模态或任务进行预训练具有挑战性。我们提出MAFM^3(Modular Adaptation of Foundation Models for Multi-Modal Medical AI),一个框架,使单个基础模型能够通过轻量级模块组件扩展到多样化的领域、任务和模态。这些组件作为专业技能集合,使系统能够根据输入类型或临床目标灵活地激活 appropriate 能力。在推理时,MAFM^3 能够灵活地为不同任务和模态提供支持。与传统适应方法分别处理每个新任务或模态不同,MAFM^3 提供了一个统一且可扩展的框架,用于高效的多任务和多模态适应。实证上,我们通过将胸部CT基础模型最初训练用于分类任务,适应为预后和分割模块来验证了我们的方案。结果在两个任务上均表现出 improved performance。此外,通过引入 PET 扫描,MAFM^3 在 Dice 评分上比各自基线提高了5%。这些发现表明,具备模块组件的基础模型并不局限于其初始训练范围,而是可以发展为医学影像中的多任务、多模态系统。本工作的代码实现可在 https://github.com/Areeb2735/CTscan_prognosis_VLM 查看。
引用
@article{arxiv.2511.11212,
title = {MAFM^3: Modular Adaptation of Foundation Models for Multi-Modal Medical AI},
author = {Mohammad Areeb Qazi and Munachiso S Nwadike and Ibrahim Almakky and Mohammad Yaqub and Numan Saeed},
journal= {arXiv preprint arXiv:2511.11212},
year = {2025}
}
备注
2 figures, 3 tables