RetinaLogos:通过标题实现高分辨率视网膜图像的精细合成
图像与视频处理
2025-07-18 v3 计算机视觉与模式识别
摘要
高质量、标记的视网膜成像数据稀缺,这在发展视力学中的机器学习模型方面 presents a significant challenge,阻碍了该领域的进展。现有方法用于合成彩色视网膜摄影 (CFP),主要依赖于预定义的疾病标签,这限制了其生成反映细粒度解剖变异、微妙疾病阶段以及超越粗糙类别类别范围内多样化病理特征能力。为克服这些挑战,我们首先引入一种创新管道,创建包含 140 万条记录的大规模、带标题的视网膜数据集,称为 RetinaLogos-1400k。具体而言,RetinaLogos-1400k 使用视觉语言模型 (VLM) 描述视网膜状况和关键结构,如视盘配置、血管分布、神经纤维层和病理特征。基于此数据集,我们采用一种新颖的三步训练框架 RetinaLogos,实现对视网膜图像的细粒度语义控制,准确捕捉不同疾病进展阶段、细微解剖变异以及特定病灶类型。通过大量实验,我们的方法在多个数据集上显示出优异性能,其中 62.07% 的文本驱动合成 CFP 被视力学家误认为是真实的。此外,合成数据在糖尿病视网膜病变分级和青光眼检测中提高了 5%-10% 的准确率。代码可在 https://github.com/uni-medical/retina-text2cfp 查看。
引用
@article{arxiv.2505.12887,
title = {RetinaLogos: Fine-Grained Synthesis of High-Resolution Retinal Images Through Captions},
author = {Junzhi Ning and Cheng Tang and Kaijing Zhou and Diping Song and Lihao Liu and Ming Hu and Wei Li and Huihui Xu and Yanzhou Su and Tianbin Li and Jiyao Liu and Jin Ye and Sheng Zhang and Yuanfeng Ji and Junjun He},
journal= {arXiv preprint arXiv:2505.12887},
year = {2025}
}