中文

论机器学习遗忘中可审计算法定义的必要性

机器学习 2022-02-22 v2 人工智能 密码学与安全 机器学习

摘要

机器学习遗忘(即让模型遗忘部分训练数据)随着隐私立法推动被遗忘权变体而变得日益重要。在深度学习背景下,机器遗忘方法大致分为两类:精确遗忘方法,即某主体通过从头重训模型正式移除了数据点对模型的影响;以及近似遗忘,即某主体近似得到精确遗忘会获得的模型参数以节省计算成本。本文首先表明,近似遗忘所依赖的定义(试图证明近似遗忘模型接近于精确重训模型)是不正确的,因为可用不同数据集得到同一模型。因此人们可以在完全不修改模型的情况下实现遗忘。我们随后转向精确遗忘方法,并探询如何验证其遗忘主张。我们的结果表明,即便给定训练轨迹,也无法正式证明训练中未使用某些数据点。因此我们得出结论:遗忘仅在算法层面有良好定义,其中某主体唯一可审计的遗忘主张是使用了一种专为审计时外部审查而设计的特定算法。

关键词

引用

@article{arxiv.2110.11891,
  title  = {On the Necessity of Auditable Algorithmic Definitions for Machine Unlearning},
  author = {Anvith Thudi and Hengrui Jia and Ilia Shumailov and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2110.11891},
  year   = {2022}
}

备注

published in 31st USENIX Security Symposium