用于医学成像的双注意力多模态融合学习
计算机视觉与模式识别
2024-12-03 v1
摘要
多模态融合学习在分类各种疾病(如皮肤癌和脑肿瘤)方面显示出巨大潜力。然而,现有方法存在三个关键局限性。首先,由于它们专注于特定疾病,通常缺乏对其他诊断任务的泛化能力。其次,它们没有充分利用来自不同模态的多种健康记录来学习鲁棒的互补信息。最后,它们通常依赖于单一的注意力机制,错过了在多种模态内部和之间使用多种注意力策略的好处。为了解决这些问题,本文提出了一种双鲁棒信息融合注意力机制(DRIFA),该机制利用了两种注意力模块,即多分支融合注意力模块和多模态信息融合注意力模块。DRIFA 可以与任何深度神经网络集成,形成一个名为 DRIFA-Net 的多模态融合学习框架。我们展示了 DRIFA 的多分支融合注意力为每种模态(如皮肤镜、巴氏涂片、MRI 和 CT 扫描)学习了增强的表示,而多模态信息融合注意力模块学习了更精细的多模态共享表示,提高了网络在多个任务上的泛化能力并增强了整体性能。此外,为了估计 DRIFA-Net 预测的不确定性,我们采用了集成蒙特卡洛 Dropout 策略。在五个具有不同模态的公开数据集上进行的大量实验表明,我们的方法始终优于最先进的方法。代码可在 https://github.com/misti1203/DRIFA-Net 获取。
引用
@article{arxiv.2412.01248,
title = {Multimodal Fusion Learning with Dual Attention for Medical Imaging},
author = {Joy Dhar and Nayyar Zaidi and Maryam Haghighat and Puneet Goyal and Sudipta Roy and Azadeh Alavi and Vikas Kumar},
journal= {arXiv preprint arXiv:2412.01248},
year = {2024}
}
备注
10 pages