中文

学习多模态医学视觉基础模型中的涌现模块表示

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

多模态医学视觉 (MV) 基础模型 (FM) 面临显著的非独立同分布 (Non-IID) 特征统计问题,这些问题跨越异构成像模态。单一自监督优化于此类数据会导致梯度冲突,使表示趋向于模态主导的捷径。本工作将此失败重新诠释为专化与协调在涌现模块性之间的不平衡,并提出 Director-Experts (DEX),一种显式调节这些动态的模块化网络。DEX 每个模块由一组专家组成,这些专家通过我们的图像级激活策略动态适应,专注于模态主导统计;同时,一个 director 通过我们的分组指数移动平均进行更新,将多专家知识蒸馏到共享空间,以实现跨模态的语义集成,从而驱动涌现模块表示的形成。我们构建了一个新的基准数据集 Medical Vision Universe,涵盖 400 万张图像和 10 种成像模态,为 DEX 提供了覆盖范围最广的 FM 级预训练。广泛的下游任务评估表明,DEX 在优化行为和可迁�性方面均取得改善,表明 DEX 是通用多模态医学 AI 的原则性步骤。我们的代码和数据集将在 https://github.com/YutingHe-list/DEX 上公开。

关键词

引用

@article{arxiv.2605.21861,
  title  = {Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models},
  author = {Yuting He and Chenyu You and Shuo Li},
  journal= {arXiv preprint arXiv:2605.21861},
  year   = {2026}
}

备注

Accepted by KDD 2026