基于组合式扩散模型的训练数据保护
机器学习
2024-10-15 v4 人工智能
密码学与安全
计算机视觉与模式识别
摘要
我们提出分隔式扩散模型(CDM),一种在不同数据源上训练不同扩散模型(或提示)并在推理时任意组合的方法。各个模型可孤立训练、在不同时间、不同分布与领域上训练,之后可组合以取得与同时在所有数据上训练的标杆模型相当的性能。此外,每个模型仅包含其训练期间所接触数据子集的信息,从而实现多种形式的训练数据保护。具体而言,CDM 为大规模扩散模型提供了完美的选择性遗忘与持续学习,并允许基于用户访问权限提供定制模型。实证上,类条件 CDM(8 分块)的质量(FID)在细粒度视觉数据集上距单体模型(无分块)在 10% 以内,且相较单体模型遗忘速度快(8 倍),FID 最大增幅为 1%。应用于文本到图像生成时,CDM 在 MSCOCO 上训练的单体模型相比,对齐度(TIFA)提升 14.33%。CDM 还可判定数据子集(归因)在生成特定样本时的重要性,并降低记忆化。
引用
@article{arxiv.2308.01937,
title = {Training Data Protection with Compositional Diffusion Models},
author = {Aditya Golatkar and Alessandro Achille and Ashwin Swaminathan and Stefano Soatto},
journal= {arXiv preprint arXiv:2308.01937},
year = {2024}
}