中文

医学视觉与语言疾病检测中多模态联邦学习的模态不一致性研究

机器学习 2024-02-09 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

多模态联邦学习(MMFL)利用每个客户端的多种模态来构建比单模态联邦学习(FL)更强大的模型。然而,不同客户端中缺失模态的影响,也称为模态不一致性,在很大程度上被忽视了。本文首次分析了模态不一致性的影响,并揭示了其与参与客户端间数据异质性的联系。我们特别考察了包含单模态和多模态客户端的不一致MMFL是否比单模态FL更有益。此外,我们探讨了解决此问题的三种潜在途径。首先,我们研究了各种自注意力机制在MMFL中对不一致性无关信息融合的有效性。其次,我们引入了一个在多模态客户端预训练的模态插补网络(MIN),用于单模态客户端中的模态转换,并研究其在缓解模态缺失问题方面的潜力。第三,我们评估了客户端级和服务器级正则化技术在减轻模态不一致性影响方面的能力。实验在两个公开可用的真实世界数据集MIMIC-CXR和Open-I上,使用胸部X光片和放射学报告,在多种MMFL设置下进行。

关键词

引用

@article{arxiv.2402.05294,
  title  = {Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection},
  author = {Pramit Saha and Divyanshu Mishra and Felix Wagner and Konstantinos Kamnitsas and J. Alison Noble},
  journal= {arXiv preprint arXiv:2402.05294},
  year   = {2024}
}

备注

42 pages