中文

用于视网膜OCT理解的掩码图像建模

计算机视觉与模式识别 2024-05-24 v1

摘要

本工作探索了掩码图像建模在学习视网膜OCT图像表示中的有效性。为此,我们利用掩码自编码器(MAE)——一种简单且可扩展的自监督学习方法——通过在真实临床环境下收集的来自41K名患者的70万张OCT图像上进行训练,获得了强大且通用的OCT图像表示。我们还首次在包含6个下游任务的挑战性测试集上对OCT模型进行了广泛评估。我们的模型在完全微调时取得了强劲的性能,同时也可以作为许多任务的通用冻结特征提取器,使用轻量级适配器。此外,我们提出了MAE预训练的扩展,将OCT与辅助模态(即红外眼底图像)融合,并学习两者的联合模型。我们证明了我们的方法在多模态下游应用中提高了性能。我们的实验使用了大多数公开可用的OCT数据集,从而便于未来的比较。我们的代码和模型权重公开在https://github.com/TheoPis/MIM_OCT。

关键词

引用

@article{arxiv.2405.14788,
  title  = {Masked Image Modelling for retinal OCT understanding},
  author = {Theodoros Pissas and Pablo Márquez-Neila and Sebastian Wolf and Martin Zinkernagel and Raphael Sznitman},
  journal= {arXiv preprint arXiv:2405.14788},
  year   = {2024}
}