中文

有效且鲁棒的多模态医学图像分析

计算机视觉与模式识别 2026-02-18 v1

摘要

多模态融合学习 (MFL) 利用来自不同成像模态(例如 MRI、CT、SPECT)的异质数据,在解决诸如皮肤癌和脑肿瘤预测等医学问题方面显示出巨大潜力。然而,现有的 MFL 方法存在三个关键局限性:a) 它们通常专精于特定模态,而忽略了跨不同模态的有效共享互补信息,从而限制了它们在多疾病分析中的泛化能力;b) 它们依赖于计算成本高昂的模型,限制了其在资源受限环境中的适用性;c) 它们缺乏对抗攻击的鲁棒性,损害了医学 AI 应用的可靠性。为了解决这些局限性,我们提出了一种新颖的多注意力集成学习 (MAIL) 网络,包含两个关键组件:a) 一个高效的残差学习注意力块,用于捕获精细的模态特定多尺度模式;b) 一个高效的多模态交叉注意力模块,用于学习跨不同模态的丰富互补共享表示。此外,为了确保对抗鲁棒性,我们通过引入随机投影滤波器和调制注意力噪声,将 MAIL 网络扩展为 Robust-MAIL。在 20 个公共数据集上的广泛评估表明,MAIL 和 Robust-MAIL 均优于现有方法,实现了高达 9.34% 的性能提升,同时将计算成本降低了高达 78.3%。这些结果凸显了我们方法的优越性,确保了比顶级竞争对手更可靠的预测。代码:https://github.com/misti1203/MAIL-Robust-MAIL。

关键词

引用

@article{arxiv.2602.15346,
  title  = {Effective and Robust Multimodal Medical Image Analysis},
  author = {Joy Dhar and Nayyar Zaidi and Maryam Haghighat},
  journal= {arXiv preprint arXiv:2602.15346},
  year   = {2026}
}

备注

Accepted at Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)