中文

机器学习中不可知与可知数据去学习的实用性与复杂性

机器学习 2025-02-13 v2 密码学与安全 最优化与控制

摘要

机器学习去学习是指从训练好的模型中选择性地移除数据的过程,这对于解决部署后隐私问题和知识差距至关重要。尽管具有这种重要性,现有方法往往是经验性的,缺乏形式保证。本文分析了近似去学习的实用性、时间和空间复杂度之间的根本性权衡,提供严格的认证,类似于差分隐私。对于分布于保留数据集相似的可忘记数据,我们表明,经验风险最小化(ERM)加上输出扰动的一个简单且通用的程序,可实现紧密的去学习-实用性-复杂性权衡,解决了此前与差分隐私中“免费去学习”之间的理论差距——后者本质上促进了此类数据的移除。然而,这些技术在分布于保留数据集显著不同的不可忘记数据上会失败,其中去学习时间复杂性甚至可能超过重新训练时间,即使只针对单个样本也是如此。为此,本文提出一种新型稳健且带噪声的梯度下降变体,能够在不牺牲实用性的前提下,实现去学习时间复杂性的摊销。

关键词

引用

@article{arxiv.2412.09119,
  title  = {The Utility and Complexity of in- and out-of-Distribution Machine Unlearning},
  author = {Youssef Allouah and Joshua Kazdan and Rachid Guerraoui and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2412.09119},
  year   = {2025}
}