中文

UrFound: 通过知识引导掩码建模迈向通用视网膜基础模型

计算机视觉与模式识别 2024-08-13 v1 人工智能

摘要

视网膜基础模型旨在从多样化的视网膜图像中学习可泛化的表示,从而促进在各种眼科任务中的标签高效模型适配。尽管取得了成功,当前的视网膜基础模型通常仅限于单一成像模态,如彩色眼底照相(CFP)或光学相干断层扫描(OCT),这限制了它们的通用性。此外,这些模型可能难以充分利用专家标注,并忽视了领域特定表示学习所必需的有价值的领域知识。为克服这些局限性,我们引入了 UrFound,一种旨在从多模态视网膜图像和领域知识中学习通用表示的视网膜基础模型。UrFound 配备了模态无关的图像编码器,并接受 CFP 或 OCT 图像作为输入。为将领域知识融入表示学习,我们以文本监督的方式编码专家标注,并提出了一种知识引导的掩码建模策略用于模型预训练。该策略涉及在根据相应视网膜图像预测被掩码文本标记的同时,重建随机掩码的视网膜图像块。该方法在统一隐空间中对齐多模态图像和文本专家标注,促进了可泛化的和领域特定的表示学习。实验结果表明,UrFound 在适配视网膜图像分析的各种任务时展现出强大的泛化能力和数据效率。通过训练约 18 万张视网膜图像,UrFound 在 8 个公开视网膜数据集上显著优于在多达 160 万张无标注图像上训练的最新视网膜基础模型。我们的代码和数据可在 https://github.com/yukkai/UrFound 获取。

关键词

引用

@article{arxiv.2408.05618,
  title  = {UrFound: Towards Universal Retinal Foundation Models via Knowledge-Guided Masked Modeling},
  author = {Kai Yu and Yang Zhou and Yang Bai and Zhi Da Soh and Xinxing Xu and Rick Siow Mong Goh and Ching-Yu Cheng and Yong Liu},
  journal= {arXiv preprint arXiv:2408.05618},
  year   = {2024}
}