中文

面向医学数据的缺失模态多模态融合架构

图像与视频处理 2023-09-28 v1 计算机视觉与模式识别 机器学习

摘要

融合多模态数据可以提升深度学习模型的性能。然而,由于患者的特异性,医学数据中缺失模态十分常见,这不利于多模态模型在实际应用中的表现。因此,使模型适应缺失模态至关重要。本研究旨在开发一种高效的医学数据多模态融合架构,该架构对缺失模态具有鲁棒性,并能进一步提升疾病诊断的性能。本研究融合了图像模态的胸部 X 光胸片、文本模态的放射学报告以及表格数据模态的结构化数值数据。每一对模态通过一个基于 Transformer 的双模态融合模块进行融合,随后三个双模态融合模块组合成一个三模态融合框架。此外,训练过程中引入了多变量损失函数,以提升模型在推理过程中对缺失模态的鲁棒性。最后,我们设计了对比实验与消融实验,以验证融合的有效性、对缺失模态的鲁棒性以及各关键组件的增益。实验在 MIMIC-IV、MIMIC-CXR 上进行,任务为 14 标签疾病诊断。采用受试者工作特征曲线下面积(AUROC)与精确率-召回率曲线下面积(AUPRC)评估模型性能。实验结果表明,我们提出的多模态融合架构有效融合了三种模态,并对缺失模态表现出强鲁棒性。该方法有望扩展至更多模态,以增强模型的临床实用性。

关键词

引用

@article{arxiv.2309.15529,
  title  = {Missing-modality Enabled Multi-modal Fusion Architecture for Medical Data},
  author = {Muyu Wang and Shiyu Fan and Yichen Li and Hui Chen},
  journal= {arXiv preprint arXiv:2309.15529},
  year   = {2023}
}