利用生成模型解耦视网膜图像的表示
计算机视觉与模式识别
2025-06-24 v3 机器学习
摘要
视网膜眼底图像在眼病的早期检测中起着至关重要的作用。然而,技术因素对这些图像的影响可能给眼科中可靠的 AI 应用带来挑战。例如,大型眼底队列往往受到相机类型等因素的混淆,存在学习捷径而非图像生成过程背后因果关系的风险。在此,我们引入了一种视网膜眼底图像的群体模型,该模型有效地将患者属性与相机效应解耦,从而实现可控且高度逼真的图像生成。为了实现这一目标,我们提出了一种基于距离相关性的解耦损失。通过定性和定量分析,我们表明我们的模型将所需信息编码在解耦的子空间中,并能够基于学习到的子空间实现可控的图像生成,从而证明了我们解耦损失的有效性。项目代码已公开:https://github.com/berenslab/disentangling-retinal-images。
引用
@article{arxiv.2402.19186,
title = {Disentangling representations of retinal images with generative models},
author = {Sarah Müller and Lisa M. Koch and Hendrik P. A. Lensch and Philipp Berens},
journal= {arXiv preprint arXiv:2402.19186},
year = {2025}
}
备注
Final journal paper version for Medical Image Analysis (MedIA)