EyeDiff:文本到图像扩散模型提升罕见眼病诊断
图像与视频处理
2024-11-18 v1 人工智能
计算机视觉与模式识别
摘要
威胁视力的视网膜疾病患病率上升给全球医疗系统带来沉重负担。深度学习为自动疾病筛查提供了有前景的解决方案,但需要大量数据。跨模态收集和标注大量眼科图像面临诸多现实挑战,尤其是罕见疾病。本文提出EyeDiff,一种从自然语言提示生成多模态眼科图像的文本到图像模型,并评估其在常见和罕见疾病诊断中的适用性。EyeDiff基于先进的潜在扩散模型,在八个大规模数据集上训练,涵盖14种眼科图像模态和80余种眼部疾病,并适配至十个多国外部数据集。生成的图像准确捕捉关键病变特征,经客观指标和人类专家评估,与文本提示高度一致。此外,引入生成图像显著提升了少数类别和罕见眼病的检测准确率,超越了传统过采样方法在解决数据不平衡方面的效果。EyeDiff有效应对了罕见疾病典型的数据不平衡和不足问题,解决了大规模标注图像采集的挑战,为提升眼科领域专家级疾病诊断模型的发展提供了变革性解决方案。
引用
@article{arxiv.2411.10004,
title = {EyeDiff: text-to-image diffusion model improves rare eye disease diagnosis},
author = {Ruoyu Chen and Weiyi Zhang and Bowen Liu and Xiaolan Chen and Pusheng Xu and Shunming Liu and Mingguang He and Danli Shi},
journal= {arXiv preprint arXiv:2411.10004},
year = {2024}
}
备注
28 pages, 2 figures