M$^4$oE: 基于专家混合的医学多模态图像分割基础模型
图像与视频处理
2024-05-16 v1
摘要
医学影像数据在不同模态和临床中心之间本质上是异质的,这对开发可泛化的基础模型提出了独特挑战。传统方法需要为每个数据集训练不同的模型,或使用共享编码器与模态特定解码器。然而,这些方法计算开销大且可扩展性差。为解决这些限制,我们提出了医学多模态专家混合(MoE)框架,利用SwinUNet架构。具体来说,MoE包含模态特定专家;每个专家单独初始化以学习编码领域知识。随后,在微调期间集成门控网络,动态调节每个专家对集体预测的贡献。这增强了模型的可解释性和泛化能力,同时保留了专家专长。同时,MoE架构增强了模型的并行处理能力,并确保模型易于适应新模态。在三个模态上的实验表明,在MICCAI FLARE22、AMOS2022和ATLAS2023数据集上,MoE相比STU-Net-L提升3.45%,相比MED3D提升5.11%,相比SAM-Med2D提升11.93%。此外,MoE的训练时间显著减少7小时,同时参数量仅为对比方法的30%。代码可在https://github.com/JefferyJiang-YF/M4oE获取。
引用
@article{arxiv.2405.09446,
title = {M$^4$oE: A Foundation Model for Medical Multimodal Image Segmentation with Mixture of Experts},
author = {Yufeng Jiang and Yiqing Shen},
journal= {arXiv preprint arXiv:2405.09446},
year = {2024}
}