中文

高效验证机器遗忘: distillation 的分区遗忘

机器学习 2025-10-22 v2

摘要

数据隐私需求日益增长,受 GDPR 和 CCPA 等法规驱动,要求机器遗忘方法能够快速移除特定训练点的影响。虽然基于数据分片和检查点 checkpointing 的验证方法(如 SISA)在单模型上实现高效遗忘,通过回退到中间状态,但在教师-学生知识蒸馏设置中面临挑战。教师端的遗忘通常迫使进行代价高昂的完整学生重新训练 due to distillation过程中信息的广泛传播。我们的主要贡献是 PURGE(Partitioned Unlearning with Retraining Guarantee for Ensembles),一种新型框架将验证遗忘与蒸馏集成。我们引入 constituent mapping 和增量多教师策略,将蒸馏过程分区,限制每个教师 constituent 的影响仅限于 distinct 学生数据子集,关键是保持数据隔离。PURGE 框架显著减少了重新训练开销,当教师端遗忘发生时,仅需部分学生更新。我们提供理论分析,量化了遗忘过程中的显著加速,并通过多个数据集的实证验证,表明 PURGE 在保持学生准确率与标准基线相当的同时,实现了这些效率 gains。

关键词

引用

@article{arxiv.2503.22539,
  title  = {Efficient Verified Machine Unlearning For Distillation},
  author = {Yijun Quan and Zushu Li and Giovanni Montana},
  journal= {arXiv preprint arXiv:2503.22539},
  year   = {2025}
}

备注

Accepted at The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)