MDA:缺失模态与内在噪声条件下的可解释且可扩展的多模态融合
机器学习
2024-11-19 v3 计算机视觉与模式识别
摘要
多模态学习在各种任务中表现出卓越性能,尤其是在医学应用中,它整合了多种医学信息以提供全面的诊断证据。然而,多模态学习仍面临若干挑战:1. 模态间的异质性;2. 模态缺失的不确定性;3. 内在噪声的影响;4. 融合结果的可解释性。本文引入模态域注意力(MDA)模型以应对上述挑战。MDA通过连续注意力构建模态间的线性关系,由于其能够自适应地为不同模态分配动态注意力,MDA可以减少对低相关性数据、缺失模态或含有固有噪声模态的关注,从而在多个公共数据集的各种任务上保持SOTA性能。此外,我们对不同模态贡献的观察表明,MDA符合既定的临床诊断影像金标准,并有望为这些标准尚未明确界定的病理提供参考。代码和数据集将公开。
引用
@article{arxiv.2406.10569,
title = {MDA: An Interpretable and Scalable Multi-Modal Fusion under Missing Modalities and Intrinsic Noise Conditions},
author = {Lin Fan and Yafei Ou and Cenyang Zheng and Pengyu Dai and Tamotsu Kamishima and Masayuki Ikebe and Kenji Suzuki and Xun Gong},
journal= {arXiv preprint arXiv:2406.10569},
year = {2024}
}