机器遗忘对会员推断攻击防御潜力的评估
密码学与安全
2026-01-23 v4
摘要
会员推断攻击(MIA)通过确定特定数据点是否属于模型训练集,构成重大的隐私风险。本工作探索性地检验了 MU 算法是否可作为一种面向特定场景的主动防御机制,在这些场景下,隐私审计识别出特定类别或个体高度易受 MIA 后训练影响。通过「钝化」模型对这些样本的类别记忆,过程有效缓解了会员信号,从而降低最易受攻击用户的 MIA 成功率。我们在四个多样化数据集和三个基于复杂度模型组上评估了三种 MU 算法:负梯度(neg grad)、SCalable Remembering and Unlearning unBound(SCRUB)以及 Selective Fine-tuning and Targeted Confusion(SFTC)。我们的发现表明,MU 可作为对抗 MIA 的有效手段,但其成功程度严重依赖于算法选择、模型容量以及对学习率的深刻敏感性。虽然负梯度常导致会员信号在忘记集和保留集方面的普遍降低,但 SFTC 指出一种关键的「分离效应」,即针对性遗忘反而强化了保留数据的会员信号。相比之下,SCRUB 提供了更为平衡的防御,对 MIA 视角的副作用最小。
引用
@article{arxiv.2508.16150,
title = {Evaluating the Defense Potential of Machine Unlearning against Membership Inference Attacks},
author = {Theodoros Tsiolakis and Vasilis Perifanis and Nikolaos Pavlidis and Christos Chrysanthos Nikolaidis and Aristeidis Sidiropoulos and Pavlos S. Efraimidis},
journal= {arXiv preprint arXiv:2508.16150},
year = {2026}
}