OBLIVIATE:面向大语言模型的鲁棒且实用的机器遗忘
计算与语言
2025-09-10 v2 人工智能
密码学与安全
机器学习
摘要
在广泛语料库上训练的大型语言模型(LLM)面临记忆敏感、受版权保护或有害内容的风险。为解决这一问题,我们提出了 \textbf{OBLIVIATE},一个鲁棒的遗忘框架,能在移除目标数据的同时保留模型效用。该框架遵循结构化的过程:提取目标 token,构建保留集,并使用由掩码、蒸馏和世界事实三部分组成的定制损失函数进行微调。使用低秩适配器确保了效率,且不妥协遗忘质量。我们在多个数据集上进行了实验,包括 Harry Potter 系列、WMDP 和 TOFU,使用了综合的指标套件:\emph{遗忘质量}(通过一种新的文档级记忆得分)、\emph{模型效用}和 \emph{流畅性}。结果证明了其在抵抗成员推理攻击、最小化对保留数据的影响以及在多种场景下保持鲁棒性方面的有效性。
引用
@article{arxiv.2505.04416,
title = {OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models},
author = {Xiaoyu Xu and Minxin Du and Qingqing Ye and Haibo Hu},
journal= {arXiv preprint arXiv:2505.04416},
year = {2025}
}
备注
To appear at EMNLP 25 main conference