利用分布匹配提升近似机器遗忘速度
机器学习
2025-08-06 v3
摘要
近似机器遗忘(AMU)通过针对保留(及遗忘)子集的专门微调,使模型能够“忘记”特定训练数据。然而,处理大规模保留子集仍主导计算运行时间,减少遗忘轮次也是一个持续的挑战。本文提出两种互补方法,以加速任意分类导向的AMU方法。首先,**Blend**——一种新颖的分布匹配数据集压缩(DC)技术,通过合并具有相似外观的图像并分配共享混合权重,显著减小保留子集规模。该方法计算开销最小,速度远超当前最先进的DC方法。其次,我们的损失导向方法**加速AMU(A-AMU)**通过增强AMU目标来加快收敛速度。A-AMU通过结合强化主要损失以加速遗忘,以及一种可微正则化器来匹配遗忘数据与分布未见数据的损失分布。我们的广泛实验表明,这种数据和损失导向的优化方法在单轮及多轮场景下显著降低端到端遗忘延迟,同时保持模型实用性和隐私。迄今为之,首次系统性地通过联合设计专门的数据集压缩技术与专用加速损失函数来解决遗忘效率问题。代码已公开于 https://github.com/algebraicdianuj/DC_Unlearning。
引用
@article{arxiv.2507.09786,
title = {Leveraging Distribution Matching to Make Approximate Machine Unlearning Faster},
author = {Junaid Iqbal Khan},
journal= {arXiv preprint arXiv:2507.09786},
year = {2025}
}
备注
10 pages, 4 figures, 4 tables