面向攻击韧性取消学习协议的权重远程(WARP)
机器学习
2026-03-04 v2 人工智能
密码学与安全
摘要
Approximate机器取消学习旨在有效地从训练好的模型中移除特定数据点的影响,为完全重新训练提供了实用替代方案。然而,它引入了隐私风险:拥有预取消学习和取消学习后模型的对手可以利用它们之间的差异进行成员推断或数据重建。我们表明,这些漏洞源于两个因素:忘却集合样本的梯度范数过大以及取消学习后的参数与原始模型接近。为显示其严重性,我们提出了针对取消学习的成员推断和重建攻击,表明多种最先进的方法(如NGP、SCRUB)仍然易受攻击。为缓解此泄露,我们引入WARP,一种可插入的远程防御机制,利用神经网络对称性以减少忘却集合的梯度能量并增加参数分散性,同时保持预测。这种重新参数化使被遗忘数据之信号更难被攻击者区分遗忘样本与非成员或通过重建恢复。我们的方法在六种取消学习算法上实现了持续的隐私收益,在黑盒和白盒设置下分别将对抗优势(AUC)降低最高可达64%和92%,同时保持保留数据的准确率。这些结果凸显了远程作为Approximate取消学习中降低攻击成功率的通用工具。
引用
@article{arxiv.2512.00272,
title = {WARP: Weight Teleportation for Attack-Resilient Unlearning Protocols},
author = {Mohammad M Maheri and Xavier Cadet and Peter Chin and Hamed Haddadi},
journal= {arXiv preprint arXiv:2512.00272},
year = {2026}
}
备注
This work has been accepted for publication at the International Conference on Learning Representations (ICLR) 2026 (to appear)