基于LoRA的残差特征对齐实现预训练模型上的机器遗忘
机器学习
2026-05-12 v2 计算机视觉与模式识别
摘要
机器遗忘是一项新兴技术,旨在从训练好的模型中移除部分训练数据,同时不显著影响模型在剩余数据上的性能。该主题在保护用户隐私和消除有害或过时数据方面变得日益重要。关键挑战在于在不损害模型在保留数据上效用的前提下,有效且高效地遗忘特定信息。对于预训练模型,微调是实现遗忘目标的重要途径。以往的工作通常微调整个模型的参数,导致巨大的计算成本。此外,微调过程可能引起中间层特征的偏移,影响模型的整体效用。本文提出了一种针对预训练模型的新颖高效机器遗忘方法,称为残差特征对齐遗忘。具体而言,我们利用LoRA(低秩适应)将模型的中间特征分解为预训练特征和残差特征。通过调整残差特征,我们在中间特征层面上将遗忘后的模型与预训练模型对齐,以同时实现遗忘和保留目标。该方法旨在使保留集上的残差为零,使遗忘集上的残差发生偏移。在多个数据集上的大量实验验证了我们方法的有效性。
引用
@article{arxiv.2411.08443,
title = {Machine Unlearning on Pre-trained Models by Residual Feature Alignment Using LoRA},
author = {Laiqiao Qin and Tianqing Zhu and Linlin Wang and Wanlei Zhou},
journal= {arXiv preprint arXiv:2411.08443},
year = {2026}
}
备注
v2: corrected a sign typo in Algorithm 1 line 13