中文

OphMAE:用于自适应眼科诊断的连接体积与平面成像的基础模型

计算机视觉与模式识别 2026-05-05 v1 人工智能

摘要

基础模型的兴起标志着医学人工智能进入新纪元,使其能够从大规模无标签数据集中提取通用表征。然而,当前眼科 AI 范式主要受限于单模态推断,与临床实践中依赖综合互补成像模态进行诊断的现实相矛盾。此外,在资源受限的环境中部署高性能 AI 常因缺乏三维成像硬件而受阻。本文提出了眼科多模态掩码自编码器(OphMAE),一种工程化的多模态基础模型,旨在协同 3D 光学相干断层扫描(OCT)的体积深度与 2D en face OCT 的平面背景。通过实施新颖的跨模态融合架构和独特的自适应推理机制,OphMAE 在由 32,765 名患者获取的 183,875 对 OCT 图像上进行预训练。在包含 8,191 名患者、48,340 对 OCT 图像的严格基准测试中,该模型实现了最先进的性能,分别以 96.9% 和 97.2% 的 AUC 取得 Age-related Macular Degeneration(AMD)和糖尿病视网膜水肿(DME)的最高 AUC。至关重要的是,OphMAE 具备稳健的工程适应性:即使仅使用单模态 2D 输入,AMD 仍可保持 93.7% 的 AUC,并在仅有 500 张标记样本时保留 95.7% 的 AUC。本工作建立了一个可扩展且具适应性的眼科 AI 框架,确保在不同任务中均能保持稳健性能。

关键词

引用

@article{arxiv.2605.02714,
  title  = {OphMAE: Bridging Volumetric and Planar Imaging with a Foundation Model for Adaptive Ophthalmological Diagnosis},
  author = {Tienyu Chang and Zhen Chen and Renjie Liang and Jinyu Ding and Jie Xu and Sunu Mathew and Amir Reza Hajrasouliha and Andrew J. Saykin and Ruogu Fang and Yu Huang and Jiang Bian and Qingyu Chen},
  journal= {arXiv preprint arXiv:2605.02714},
  year   = {2026}
}

备注

29 pages, 10 figures, 1 table