LUNE:基于负样本的 LoRA 微调高效 LLM 遗忘方法
机器学习
2025-12-09 v1 计算与语言
摘要
大型语言模型(LLM)从广泛训练语料库中获取了大量知识,但它们往往无法在需要时删除特定信息,这使得处理隐私、偏见缓解和知识修正变得困难。传统的模型遗忘方法需要计算代价高昂的微调或直接权重编辑,使其难以在实际部署中应用。在本工作中,我们提出了 LoRA-based Unlearning with Negative Examples(LUNE),一个轻量级框架,通过仅更新低秩适配器并冻结主干网络来执行仅负样本遗忘,从而局部化编辑并避免破坏性的全局变化。利用低秩适应(LoRA),LUNE 针对中间表示进行抑制(或替换),其计算和内存开销比全微调或直接权重编辑低一个数量级。在多个事实遗忘任务上的广泛实验表明,LUNE:(I)实现了与全微调和记忆编辑方法相当的有效性,(II)将计算成本降低了约一个数量级。
引用
@article{arxiv.2512.07375,
title = {LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples},
author = {Yezi Liu and Hanning Chen and Wenjun Huang and Yang Ni and Mohsen Imani},
journal= {arXiv preprint arXiv:2512.07375},
year = {2025}
}