理解近似忘却中的微调:一个理论视角
机器学习
2025-11-25 v3 机器学习
摘要
机器忘却(Machine Unlearning)已成为重要的研究领域,旨在从训练好的模型中“删除”特定的数据子集。微调(Fine-tuning, FT)方法因能有效保留模型性能而成为近似忘却的基本方法之一。然而,总体观察到,朴素的微调方法在忘却目标数据方面始终难以胜任。本文在线性回归框架内,对FT方法进行首次的理论分析,深入探讨了这一现象。我们的分析表明,尽管FT模型可实现零剩余损失,但它们无法忘却忘却数据,因为预训练模型保留了其影响,微调过程未能充分抵消这种影响。为此,我们提出一种新颖的基于保留的掩码策略(Retention-Based Masking, RBM),该策略根据剩余数据集构建权重灵敏度图,不同于现有方法侧重于忘却数据集。我们的理论分析表明,RBM不仅显著提高忘却准确性(Unlearning Accuracy, UA),还通过保留忘却数据集和剩余数据集之间共享的特征,确保更高的保留准确性(Retaining Accuracy, RA)。在合成数据和真实数据集上的实验验证了我们的理论见解,显示出RBM在平衡UA、RA和差异性指标方面超越了现有的掩码方法。
引用
@article{arxiv.2410.03833,
title = {Understanding Fine-tuning in Approximate Unlearning: A Theoretical Perspective},
author = {Meng Ding and Rohan Sharma and Changyou Chen and Jinhui Xu and Kaiyi Ji},
journal= {arXiv preprint arXiv:2410.03833},
year = {2025}
}
备注
23 pages,5 figures