GENIU:受限数据访问下的不平衡数据类擦除
机器学习
2024-06-13 v1
摘要
随着数据隐私日益受到重视,机器学习擦除的重要性大幅提升。类擦除涉及使训练好的模型忘记属于特定类别的数据,这在分类任务中尤为重要,因为它们占今天作为即服务(MLaaS)的机器学习任务的绝大多数。通常通过在原始数据中排除待擦除数据(即忘记数据)来重新训练模型来实现类擦除。然而,在擦除阶段无法获得原始数据,这导致了受限数据访问下的类擦除问题的探索。虽然当前的受限数据访问擦除方法通常通过训练好的神经网络分类器生成代理样本,但它们通常关注训练和忘记平衡数据。然而,不平衡的原始数据可能导致这些代理样本和擦除过程出现问题,尤其当待忘记的数据主要来自多数类时。为此,我们提出GENerative Imbalanced Unlearning(GENIU)框架。GENIU利用变分自编码器(VAE)同时训练代理生成器与原始模型。这些生成的代理准确代表每个类别,并在擦除阶段中被利用,消除对原始训练数据的依赖。为进一步缓解因忘记多数类而导致的性能下降,我们引入一种可与生成代理配合的批内调优策略。GENIU是首个在不平衡数据设置和受限数据访问条件下实用的类擦除框架,确保为未来擦除保留关键信息。实验结果表明,GENIU在实际场景中优于现有方法,证明了其有效性。
引用
@article{arxiv.2406.07885,
title = {GENIU: A Restricted Data Access Unlearning for Imbalanced Data},
author = {Chenhao Zhang and Shaofei Shen and Yawen Zhao and Weitong Tony Chen and Miao Xu},
journal= {arXiv preprint arXiv:2406.07885},
year = {2024}
}