机器遗忘的实用方法
机器学习
2024-06-14 v1 人工智能
摘要
机器学习模型通常包含大量数据,引发显著隐私 concerns。机器遗忘(即从训练好的模型中去除特定数据点影响的能力)旨在解决这些问题。本文探讨了机器遗忘的实用方法,聚焦于一阶 epoch 的梯度上升方法。关键发现包括:1. 单 epoch 与多 epoch 的遗忘:一阶 epoch 的梯度遗忘比多 epoch 梯度更有效。2. 基于层的遗忘:GPT-2 中的嵌入层对有效遗忘至关重要。输出层 (11 和 12) 的梯度无显著影响。仅使用嵌入层即可实现高效遗忘,空间复杂度减半。3. 影响函数与评分:使用 Hessian-Vector Product 以及激活张量的点积用于量化遗忘。4. 梯度上升注意事项:需要进行校准,以避免在遗忘过程中对特定数据点过度敏感,从而提前终止过程。5. 模糊匹配 vs. 迭代遗忘:模糊匹配技术将模型引向新最优点,而迭代遗忘提供更为彻底的模态。我们的实证评估表明,一阶梯度上升在机器遗忘方面优于整体模型梯度上升。这些结果凸显了机器遗忘在提升数据隐私和符合 GDPR、CCPA 等法规方面的潜力。本研究强调确立全面评估遗忘过程的重要性。
引用
@article{arxiv.2406.09391,
title = {A More Practical Approach to Machine Unlearning},
author = {David Zagardo},
journal= {arXiv preprint arXiv:2406.09391},
year = {2024}
}