中文

FPAN:通过对 Token Embedding 进行细粒度概率加噪缓解扩散模型的复制问题

计算机视觉与模式识别 2025-05-29 v1

摘要

扩散模型在生成高质量图像方面展现出了显著潜力。然而,其复制训练数据的倾向引发了严重的隐私担忧,特别是当训练数据集包含敏感或私人信息时。现有的缓解策略主要侧重于减少图像重复、修改交叉注意力机制以及改变扩散模型去噪骨干架构。此外,最近的工作表明,向文本嵌入添加一致的小量噪声可以在一定程度上减少复制。在本工作中,我们首先分析了添加不同量噪声的影响。基于我们的分析,我们提出了一种细粒度噪声注入技术,以概率方式向 token embedding 添加大量噪声。我们将我们的方法称为细粒度概率加噪(FPAN)。通过大量实验,我们表明,与基线扩散模型相比,我们提出的 FPAN 能够将复制平均减少 28.78%,且不会显著影响图像质量,并比先前的一致幅度加噪方法高出 26.51%。此外,当与其他现有缓解方法结合使用时,我们的 FPAN 方法可以进一步将复制减少高达 16.82%,且图像质量相似甚至有所提升。

关键词

引用

@article{arxiv.2505.21848,
  title  = {FPAN: Mitigating Replication in Diffusion Models through the Fine-Grained Probabilistic Addition of Noise to Token Embeddings},
  author = {Jingqi Xu and Chenghao Li and Yuke Zhang and Peter A. Beerel},
  journal= {arXiv preprint arXiv:2505.21848},
  year   = {2025}
}