增强基于微调的大语言模型遗忘的通用框架
机器学习
2025-03-25 v2 计算与语言
摘要
遗忘技术旨在从大型语言模型(LLM)中移除受版权保护及隐私敏感数据。现有方法主要依赖微调,可分为基于梯度上升和抑制两种。然而,这些方法常导致模型工具性能下降。本文致力于开发增强微调式遗忘方法实用性的通用框架。为此,我们首先探讨GA-based方法与抑制方法之间的共性。我们揭示,GA-based方法通过区分目标数据并抑制相关生成实现遗忘,这本质上与抑制方法采用的策略相同。基于此,我们引入Gated Representation UNlearning(GRUN),包含两个组成部分:用于区分目标数据的软门函数,以及基于表示微调(ReFT)的抑制模块。实验表明,GRUN显著提升遗忘与实用性,同时适用于所有微调式方法,具备高效且适合顺序遗忘的特性。
引用
@article{arxiv.2502.17823,
title = {A General Framework to Enhance Fine-tuning-based LLM Unlearning},
author = {Jie Ren and Zhenwei Dai and Xianfeng Tang and Hui Liu and Jingying Zeng and Zhen Li and Rahul Goutam and Suhang Wang and Yue Xing and Qi He and Hui Liu},
journal= {arXiv preprint arXiv:2502.17823},
year = {2025}
}