利用 per-instance 隐私进行机器遗忘
机器学习
2025-05-27 v1
摘要
我们提出了一种原则化的、针对每个实例的方法,用于量化遗忘的难度。我们首先通过分析带噪声的梯度下降进行遗忘(Chien 等,2024),用 per-instance 隐私损失(Thudi 等,2024)取代最坏情况隐私损失上限,以获得更好的实用性-遗忘权衡。每个 per-instance 隐私损失都对不包含该单个数据点的再训练进行界定。为了展示理论的实际适用性,我们给出了实证结果,表明我们的理论预测同时适用于带噪声的随机梯度 Langevin 动力学(SGLD)以及标准无显式噪声的微调。我们进一步表明,per-instance 隐私损失与几个现有数据难度指标高度相关,同时识别了更难的样本组,并引入了基于损耗壁垒的新型评估方法。总体而言,我们的发现为更高效、针对性强的遗忘策略奠定了基础,这些策略针对单个数据点的独特性进行优化。
引用
@article{arxiv.2505.18786,
title = {Leveraging Per-Instance Privacy for Machine Unlearning},
author = {Nazanin Mohammadi Sepahvand and Anvith Thudi and Berivan Isik and Ashmita Bhattacharyya and Nicolas Papernot and Eleni Triantafillou and Daniel M. Roy and Gintare Karolina Dziugaite},
journal= {arXiv preprint arXiv:2505.18786},
year = {2025}
}