GUARD:基于自适应限制与检测的生成时 LLM 无学习
计算与语言
2025-05-20 v1
摘要
大型语言模型(LLM)在记忆广泛知识方面表现突出,但选择性遗忘特定知识的能力对于确保部署模型的安全和合规性至关重要。现有无学习方法通常需要forget data、retain data和校准模型等额外资源进行微调。这些额外的梯度步骤模糊了forget 与 retain 知识之间的决策边界,使无学习往往以牺牲整体性能为代价。为避免微调的负面影响,仅在推理时通过安全防护模型免于生成与忘却目标相关的响应,而不破坏文本生成的流畅性更为理想。本文提出生成时无学习通过自适应限制与检测(Generation-time Unlearning via Adaptive Restriction and Detection, GUARD)框架,使其在 LLM 生成期间实现动态无学习。具体而言,我们首先使用提示分类器检测无学习目标并提取相应的禁令 token。随后,我们通过 token 匹配和语义匹配相结合动态惩罚和过滤生成候选 token,从而有效防止模型泄露被遗忘内容。在哈里波特数据集和 MUSE 基准上的版权内容无学习任务,以及 TOFU 数据集上的实体无学习任务的实验结果表明,GUARD 在各种任务中实现强忘却质量,同时对 LLM 通用能力几乎没有退化,在忘却与实用性之间取得了优异的平衡。
引用
@article{arxiv.2505.13312,
title = {GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection},
author = {Zhijie Deng and Chris Yuhao Liu and Zirui Pang and Xinlei He and Lei Feng and Qi Xuan and Zhaowei Zhu and Jiaheng Wei},
journal= {arXiv preprint arXiv:2505.13312},
year = {2025}
}