M-IDoL: 医学基础模型中的信息分解用于模态特定与多样化表征学习
计算机视觉与模式识别
2026-05-19 v2
摘要
医学基础模型(MFM)旨在从多模态医学图像中学习通用表征,以有效泛化至多样化的下游临床任务。然而,大多数现有 MFM 都存在信息模糊问题,即将多模态表征混合到单一嵌入空间中,导致模态特定性和多样性下降。在本文中,我们提出M-IDoL,一种通过两种目标实现的信息分解的自监督 MFM: i) 通过将多模态表征分散到可分离的混合专家(MoE)子空间来最大化跨模态熵,以实现跨模态的表征特定性; ii) 通过在每个 MoE 子空间内进行细粒度语义判别来最小化单模态不确定性,以丰富每个模态内的表征多样性。经过在 115 万张医学图像上的预训练,M-IDoL i) 在 21 个下游临床任务上实现优异的泛化性能,在五种医学成像模态(如 X 光、眼底、OCT、皮肤病理和组织病理)上超越 20 个基础模型; ii) 学习到模态特定和多样化的表征,显示出跨模态特征聚类的更清晰分离,以及每个模态内更细粒度的特征判别。
引用
@article{arxiv.2604.08936,
title = {M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model},
author = {Yihang Liu and Longzhen Yang and Jiaxiong Yang and Ying Wen and Lianghua He and Heng Tao Shen},
journal= {arXiv preprint arXiv:2604.08936},
year = {2026}
}