VisionCLIP:基于医学AI生成内容的伦理语言-图像基础模型用于通用视网膜图像分析
计算机视觉与模式识别
2024-03-19 v1 人工智能
摘要
通用基础模型已在医疗领域带来了新的能力。然而,随着对高质量标注数据的需求不断增长,而患者隐私问题也日益加剧。将医学人工智能生成内容(Med-AIGC)作为无尽资源库的利用,因而成为解决上述挑战的潜在方案。本文利用100万组开源合成视网膜图像配有自然语言描述,构建了一个用于视网膜图像分析的伦理语言-图像基础模型,命名为VisionCLIP。VisionCLIP在三个外部数据集上实现了与基于真实数据预训练的现有方法相媲美的零样性能。通过人工合成图像及其对应的文本数据进行训练,使医疗基础模型能够成功吸收疾病症状学知识,从而规避了潜在的患者保密风险。
引用
@article{arxiv.2403.10823,
title = {VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis},
author = {Hao Wei and Bowen Liu and Minqing Zhang and Peilun Shi and Wu Yuan},
journal= {arXiv preprint arXiv:2403.10823},
year = {2024}
}