魔鬼藏在提示词中:去识别痕迹增强合成胸片 X 光的记忆风险
图像与视频处理
2025-02-17 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
生成模型,特别是文本到图像扩散模型,在医学图像分析中发挥着关键作用。然而,这些模型容易记忆训练数据,构成对患者隐私的重大风险。合成胸片 X 光生成是医学图像分析中最常见的应用,MIMIC-CXR 数据集是该任务的主要数据仓库。本研究首次系统性地识别了贡献训练数据记忆最多的提示词和文本标记。我们的分析揭示了两个意外发现:(1)包含去识别程序痕迹(用于隐藏受保护健康信息的标记)的提示词最易被记忆,(2)在所有标记中,去识别标记对记忆贡献最大。这凸显了标准匿名化实践和使用 MIMIC-CXR 数据集进行文本到图像合成的更广泛问题。此外,现有的推理时间记忆减缓策略无效,未能充分减少模型对记忆文本标记的依赖。在此基础上,我们提出了面向不同利益相关者的可操作策略,以增强隐私并提高医学影像中生成模型的可靠性。最后,我们的结果为未来开发和基准测试使用 MIMIC-CXR 数据集进行合成胸片 X 光生成的记忆减缓技术奠定了基础。匿名代码已公开于 https://anonymous.4open.science/r/diffusion_memorization-8011/
引用
@article{arxiv.2502.07516,
title = {The Devil is in the Prompts: De-Identification Traces Enhance Memorization Risks in Synthetic Chest X-Ray Generation},
author = {Raman Dutt},
journal= {arXiv preprint arXiv:2502.07516},
year = {2025}
}