先适配后遗忘:探索生成对抗网络中参数空间的语义以实现遗忘
机器学习
2025-02-13 v2 人工智能
计算机视觉与模式识别
摘要
由于对隐私和监管合规的日益关注,对生成模型的输出进行规制成为必要。为此,本工作的目标是防止预训练生成对抗网络(GAN)生成包含不期望特征的输出,且底层训练数据集不可访问。我们的方法受如下观察启发:GAN 的参数空间展现出有意义的方向,可用于抑制特定不期望特征。然而,此类方向通常会导致生成样本质量下降。我们提出的两阶段方法“Adapt-then-Unlearn(先适配后遗忘)”擅长遗忘此类不良特征,同时保持生成样本的质量。在初始阶段,我们在用户提供的一组负样本(包含不期望特征)上适配预训练 GAN。随后,我们使用正样本以及一种排斥正则化器训练原始预训练 GAN。该正则化器鼓励学习到的模型参数远离适配模型(第一阶段)的参数,同时不降低生成质量。我们提供了该方法的理论洞见。据我们所知,我们的方法是首个解决高保真 GAN(如 StyleGAN)领域内遗忘问题的方法。我们通过综合实验验证了方法的有效性,包括在 MNIST 和 AFHQ 数据集上的类别级遗忘,以及在 CelebA-HQ 数据集上的特征级遗忘任务。我们的代码和实现可在 https://github.com/atriguha/Adapt_Unlearn 获取。
引用
@article{arxiv.2309.14054,
title = {Adapt then Unlearn: Exploring Parameter Space Semantics for Unlearning in Generative Adversarial Networks},
author = {Piyush Tiwary and Atri Guha and Subhodip Panda and Prathosh A. P},
journal= {arXiv preprint arXiv:2309.14054},
year = {2025}
}
备注
Accepted at Transactions on Machine Learning Research (TMLR)