中文

通过解耦表示实现眼科疾病分级的鲁棒多模态学习

计算机视觉与模式识别 2025-06-26 v2 人工智能

摘要

本文探讨了眼科医生通常如何依赖多模态数据来提高诊断准确性。然而,由于医疗设备的缺乏和对数据隐私的担忧,完整的多模态数据在实际应用中极为罕见。传统深度学习方法通常通过在潜在空间中学习表示来解决这些问题。然而,本文强调了这些方法的两个关键局限性:(i) 复杂模态中与任务无关的冗余信息(例如大量切片)导致潜在空间表示中出现显著冗余;(ii) 重叠的多模态表示使得难以提取每种模态的独特特征。为了克服这些挑战,作者提出了本质点与解耦表示学习(EDRL)策略,该策略将自蒸馏机制集成到端到端框架中,以增强特征选择和解耦,从而实现更鲁棒的多模态学习。具体而言,本质点表示学习模块选择可提高疾病分级性能的判别性特征。解耦表示学习模块将多模态数据分离为模态共有表示和模态独有表示,减少了特征纠缠,并增强了眼科疾病诊断的鲁棒性和可解释性。在多模态眼科数据集上的实验表明,所提出的 EDRL 策略显著优于当前最先进的方法。

关键词

引用

@article{arxiv.2503.05319,
  title  = {Robust Multimodal Learning for Ophthalmic Disease Grading via Disentangled Representation},
  author = {Xinkun Wang and Yifang Wang and Senwei Liang and Feilong Tang and Chengzhi Liu and Ming Hu and Chao Hu and Junjun He and Zongyuan Ge and Imran Razzak},
  journal= {arXiv preprint arXiv:2503.05319},
  year   = {2025}
}

备注

10pages