中文

迈向鲁棒的多模态表示:一种基于自适应专家与对齐的统一方法

机器学习 2025-03-13 v1 计算机视觉与模式识别

摘要

医疗领域依赖多种类型的数据,如医学影像、遗传信息和临床记录,以改善诊断和治疗。然而,由于隐私限制、成本和技术问题,数据缺失是常见挑战,使得许多现有的多模态模型不可靠。为解决这一问题,我们提出了一种新的多模态模型——混合专家、对称对齐与重建(MoSARe),一种能够处理不完整多模态数据同时保持高准确率的深度学习框架。MoSARe 融合了专家选择、跨模态注意力和对比学习,以提升特征表示和决策能力。我们的结果表明,MoSARe 在数据完整的情况下优于现有模型。此外,即使部分数据缺失,它也能提供可靠的预测。这使其在真实医疗场景中特别有用,包括资源受限的环境。我们的代码公开可用,地址为 https://github.com/NazaninMn/MoSARe。

关键词

引用

@article{arxiv.2503.09498,
  title  = {Towards Robust Multimodal Representation: A Unified Approach with Adaptive Experts and Alignment},
  author = {Nazanin Moradinasab and Saurav Sengupta and Jiebei Liu and Sana Syed and Donald E. Brown},
  journal= {arXiv preprint arXiv:2503.09498},
  year   = {2025}
}