改进文本条件潜在扩散用于癌症病理学
图像与视频处理
2024-12-10 v1 计算机视觉与模式识别
机器学习
摘要
过去十年生成模型的发展使得超高真实感的数据合成成为可能。尽管潜在有益,这种合成数据生成过程在癌症组织病理学中相对未被充分探索。扩散算法是合成真实图像的一种方法,它迭代地将图像转换为噪声并从噪声中学习恢复过程[Wang and Vastola, 2023]。虽然有效,但对于高分辨率图像计算代价极高,使得组织病理学应用不可行。变分自编码器(VAE)的发展使我们能够在潜在空间中学习复杂高分辨率图像的表示。其重要副产品是能够将高分辨率图像压缩到潜在空间并无损恢复。扩散与VAE的结合使我们能够在自编码器的潜在空间中进行扩散,从而利用扩散的真实生成能力同时保持合理的计算需求。Rombach et al. [2021b]和Yellapragada et al. [2023]为这一任务构建了基础模型,为生成真实组织病理学图像铺平了道路。在本文中,我们讨论了当前方法[Yellapragada et al., 2023]的不足之处,在过程中解决了关键错误并提出了改进。我们的方法实现了21.11的FID分数,比[Yellapragada et al., 2023]中的SOTA方法提升了1.2 FID,同时训练时GPU内存使用减少了7%。
引用
@article{arxiv.2412.06487,
title = {Improving text-conditioned latent diffusion for cancer pathology},
author = {Aakash Madhav Rao and Debayan Gupta},
journal= {arXiv preprint arXiv:2412.06487},
year = {2024}
}