中文

无条件潜在扩散模型记忆患者影像数据:对开放共享合成数据的影响

图像与视频处理 2025-01-09 v3 计算机视觉与模式识别 机器学习

摘要

AI模型在医学领域有着广泛的应用。然而,实现最佳性能需要访问大量的医疗数据,而这些数据通常不易获得。此外,保护患者隐私的必要性限制了患者数据与第三方甚至机构内部的共享。最近,生成式AI模型通过提出合成数据作为真实患者数据的替代品,在促进开放数据共享方面获得了关注。尽管前景广阔,但其中一些模型容易记忆患者数据,即模型生成患者数据的副本而不是新颖的合成样本。考虑到问题的重要性,令人惊讶的是,它在医学影像社区中受到的关注相对较少。为此,我们评估了无条件潜在扩散模型中的记忆问题。我们训练潜在扩散模型在CT、MR和X射线数据集上生成合成数据。然后,我们利用我们新颖的自监督副本检测方法检测被记忆的训练数据量,并进一步研究了可能影响记忆的各种因素。我们的研究结果显示,所有数据集中的患者数据记忆程度都出奇地高。与非扩散生成模型(如自编码器和生成对抗网络)的比较表明,虽然潜在扩散模型更容易记忆,但总体而言,它们在合成质量上优于非扩散模型。进一步的分析表明,使用增强策略、小型架构和增加数据集可以减少记忆,而过度训练模型则会增强记忆。总的来说,我们的结果强调了在私有医学影像数据集上仔细训练生成模型,以及在共享用于医学研究和应用之前检查合成数据以确保患者隐私的重要性。

关键词

引用

@article{arxiv.2402.01054,
  title  = {Unconditional Latent Diffusion Models Memorize Patient Imaging Data: Implications for Openly Sharing Synthetic Data},
  author = {Salman Ul Hassan Dar and Marvin Seyfarth and Isabelle Ayx and Theano Papavassiliu and Stefan O. Schoenberg and Robert Malte Siepmann and Fabian Christopher Laqua and Jannik Kahmann and Norbert Frey and Bettina Baeßler and Sebastian Foersch and Daniel Truhn and Jakob Nikolas Kather and Sandy Engelhardt},
  journal= {arXiv preprint arXiv:2402.01054},
  year   = {2025}
}