中文

基于马尔可夫链蒙特卡罗的机器遗忘:遗忘那些需要被忘却的

机器学习 2022-03-01 v1 密码学与安全

摘要

随着机器学习(ML)模型在许多现实应用中的使用日益普及,模型维护面临若干实际挑战。其中一项挑战是“撤销”用于训练模型的特定数据子集的影响。该特定子集可能包含攻击者注入的恶意或对抗数据,从而影响模型性能。另一原因可能是服务提供商需要移除特定用户的数据以尊重用户隐私。在这两种情况下,问题都是从已训练模型中“遗忘”特定的训练数据子集,而无需承担从头重新训练整个模型的高昂代价。为此,本文提出一种基于马尔可夫链蒙特卡罗的机器遗忘(MCU)算法。MCU 有助于从训练数据集子集中有效且高效地遗忘已训练模型。此外,我们表明借助 MCU 能够解释训练数据集子集对模型预测的影响。因此,MCU 可用于检查数据子集以识别待移除的对抗数据。类似地,MCU 可用于从已训练 ML 模型中擦除用户个人数据的 lineage,从而维护用户的“被遗忘权”。我们在真实世界的钓鱼与糖尿病数据集上对所提 MCU 算法进行了实证评估。结果表明,MCU 能通过高效移除训练数据集子集的影响实现令人满意的性能,并优于一种利用剩余数据集的现有算法。

关键词

引用

@article{arxiv.2202.13585,
  title  = {Markov Chain Monte Carlo-Based Machine Unlearning: Unlearning What Needs to be Forgotten},
  author = {Quoc Phong Nguyen and Ryutaro Oikawa and Dinil Mon Divakaran and Mun Choon Chan and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2202.13585},
  year   = {2022}
}

备注

Proceedings of the 2022 ACM Asia Conference on Computer and Communications Security (ASIA CCS '22), May 30-June 3, 2022, Nagasaki, Japan