English

MedMIX: Modality-Internal Expert Fusion for Multimodal Medical Diagnosis

Machine Learning 2026-05-19 v1

Abstract

Multimodal clinical prediction faces three challenges: multiple foundation models (FMs) with complementary strengths per modality, pervasive missing modalities at training and test time, and sample-specific variation in modality contributions. We introduce MedMIX, a multimodal framework that combines intra-modality expert fusion, learned inter-modality fusion, and training-only large--small model collaboration for robust medical prediction under incomplete modalities. Within each modality, MedMIX aggregates complementary embeddings from multiple small expert models; across modalities, it performs learned fusion over available modalities; and during training, it leverages large teacher models to improve deployed representations without additional inference cost. Across three heterogeneous benchmarks (OpenI, MIMIC-IV-MM, and MMIST-ccRCC), MedMIX achieves consistently strong performance while remaining robust under controlled missing-modality perturbations, and further demonstrates sustained robustness under cross-cohort shift on MIMIC-III. These results highlight MedMIX as a practical framework that unifies within-modality expert collaboration, sample-specific cross-modality fusion, and efficient large--small model collaboration while remaining robust to incomplete modalities.

Keywords

Cite

@article{arxiv.2605.16639,
  title  = {MedMIX: Modality-Internal Expert Fusion for Multimodal Medical Diagnosis},
  author = {Seungik Cho and Anqi Li and Wei Qiu},
  journal= {arXiv preprint arXiv:2605.16639},
  year   = {2026}
}