AMUN:对抗性机器忘卸
机器学习
2025-11-17 v3 密码学与安全
摘要
机器忘卸(machine unlearning)指用户可请求删除忘记数据集的功能,因众多隐私法规而日益重要。初始的“精确”忘卸工作(如重新训练)造成较大的计算开销。然而,尽管计算开销较小,“近似”方法在实际效果上远不如精确忘卸:产生的模型在忘记数据集和测试(即未见)数据集上无法获得可比的准确度和预测置信度。基于这一观察,我们提出一种新的忘卸方法——对抗性机器忘卸(AMUN),其在图像分类任务中超越了先前的最先进技术(SOTA)方法。AMUN 通过对忘记样本对应的对抗性样本进行微调,降低模型对这些样本的置信度。对抗性样本自然属于模型在输入空间上施加的分布;对距离相应忘记样本最近的对抗性样本进行微调(1)将更改局部化到模型每个忘记样本周围决策边界附近,(2)避免对模型全局行为的剧烈改变,从而保留模型在测试样本上的准确度。在使用 AMUN 对 CIFAR-10 随机 10% 的样本进行忘卸后,我们观察到即使是最先进的成员推断攻击也无法做得比随机猜测好。
引用
@article{arxiv.2503.00917,
title = {AMUN: Adversarial Machine UNlearning},
author = {Ali Ebrahimpour-Boroojeny and Hari Sundaram and Varun Chandrasekaran},
journal= {arXiv preprint arXiv:2503.00917},
year = {2025}
}