中文

增强遮蔽图像建模以避免多模态 MRI 数据集中的模型崩溃

图像与视频处理 2025-01-17 v4 人工智能 计算机视觉与模式识别

摘要

多模态磁共振成像 (MRI) 提供了来自不同视角的病灶信息,用于计算机辅助诊断。深度学习算法适用于识别特定解剖结构、分割病灶和分类疾病。由于高成本,手动标签有限,这阻碍了准确性的进一步提高。自监督学习,特别是遮蔽图像建模 (MIM),在利用无标签数据方面显示出前景。然而,我们发现在应用于多模态 MRI 数据集时会出现模型崩溃。随着崩溃模型的应用,下游任务的性能没有任何改进。为了解决模型崩溃,我们分析并在两种类型中加以解决:完全崩溃和维度崩溃。我们发现,由于多模态 MRI 数据集中的崩溃损失值低于通常收敛的损失值,因此会发生完全崩溃。基于此,引入混合遮蔽模式 (HMP) 遮蔽策略,以将崩溃损失值提升到通常收敛的损失值以上并避免完全崩溃。此外,我们揭示了维度崩溃源于 MIM 中特征均匀性不足的问题。我们通过引入金字塔条形双胞胎 (PBT) 模块作为显式正则化方法来缓解维度崩溃。总之,我们构建了包含 HMP 和 PBT 模块的增强 MIM (E-MIM) 以避免多模态 MRI 中的模型崩溃。在三个多模态 MRI 数据集上进行实验,以验证该方法在防止两种模型崩溃方面的有效性。通过防止模型崩溃,模型的训练变得更加稳定,导致在分割和分类任务方面性能得到显著提升。代码已公开于 https://github.com/LinxuanHan/E-MIM。

关键词

引用

@article{arxiv.2407.10377,
  title  = {Enhanced Masked Image Modeling to Avoid Model Collapse on Multi-modal MRI Datasets},
  author = {Linxuan Han and Sa Xiao and Zimeng Li and Haidong Li and Xiuchao Zhao and Yeqing Han and Fumin Guo and Xin Zhou},
  journal= {arXiv preprint arXiv:2407.10377},
  year   = {2025}
}

备注

This work has been submitted to the lEEE for possible publication. copyright may be transferred without notice, after which this version may no longer be accessible