中文

通过投影网络实现异构维度数据的深度多模态融合

计算机视觉与模式识别 2024-02-05 v1 图像与视频处理

摘要

多模态成像的应用已显著改善了许多疾病的诊断与治疗。与临床实践类似,一些研究已证明,使用基于深度学习的方法进行多模态融合有助于自动分割和分类。然而,当前的分割方法仅限于融合具有相同维度的模态(例如,3D+3D、2D+2D),这并非总是可行,而分类方法所实现的融合策略又与定位任务不兼容。在这项工作中,我们提出了一种新颖的基于深度学习的框架,用于融合具有异构维度(例如,3D+2D)的多模态数据,并且该框架与定位任务兼容。所提出的框架提取不同模态的特征,并将它们投影到公共特征子空间中。然后,投影后的特征被融合并进一步处理以获得最终预测。该框架在以下任务上得到了验证:地理萎缩(GA,年龄相关性黄斑变性的一种晚期表现)的分割,以及多模态视网膜成像中视网膜血管(RBV)的分割。我们的结果表明,所提出的方法在GA和RBV分割任务上,分别以高达3.10%和4.64%的Dice系数,优于最先进的单模态方法。

关键词

引用

@article{arxiv.2402.01311,
  title  = {Deep Multimodal Fusion of Data with Heterogeneous Dimensionality via Projective Networks},
  author = {José Morano and Guilherme Aresta and Christoph Grechenig and Ursula Schmidt-Erfurth and Hrvoje Bogunović},
  journal= {arXiv preprint arXiv:2402.01311},
  year   = {2024}
}

备注

Accepted for publication in the IEEE Journal of Biomedical and Health Informatics (JBHI)