中文

多模态眼科诊断概览:从任务特定方法到基础模型

图像与视频处理 2025-08-07 v1 人工智能 计算机视觉与模式识别

摘要

视力障碍是全球健康面临的重大挑战,多模态成像提供的互补信息对于准确的眼科诊断至关重要。本综述系统性地审阅了2025年之前在眼科领域最新进展的多模态深度学习方法。综述重点聚焦于两大类别:任务特定的多模态方法和大规模多模态基础模型。任务特定方法针对特定临床应用(如病灶检测、疾病诊断和图像合成)进行设计,利用包括彩色眼底照相术、光学相干断层扫描和血管造影在内的多种成像模态。另一方面,基础模型结合了精细的视觉-语言架构和大型语言模型,这些模型在多样化的眼科数据集上进行预训练,使其能够实现稳健的跨模态理解、自动化临床报告生成和决策支持。综述批判性地审查了重要数据集、评估指标以及包括自监督学习、注意力融合和对比对齐在内的方法创新。它还讨论了正在进行的挑战,如数据差异性、标注有限、缺乏可解释性以及跨不同患者群体的泛化性问题。最后,综述勾勒了一些有前景的未来方向,强调强化学习驱动的推理框架和超广视野成像,以创建面向眼科的智能、可解释且临床可应用的AI系统。

关键词

引用

@article{arxiv.2508.03734,
  title  = {A Survey of Multimodal Ophthalmic Diagnostics: From Task-Specific Approaches to Foundational Models},
  author = {Xiaoling Luo and Ruli Zheng and Qiaojian Zheng and Zibo Du and Shuo Yang and Meidan Ding and Qihao Xu and Chengliang Liu and Linlin Shen},
  journal= {arXiv preprint arXiv:2508.03734},
  year   = {2025}
}