Leak@$k$:概率解码下 LLM 忘却无效
机器学习
2026-05-29 v3
摘要
大型语言模型 (LLM) 的忘却对于监管合规以及构建避免生成私人、有毒、非法或受版权保护内容的伦理生成式 AI 系统至关重要。尽管取得了快速进展,但本文表明几乎所有现有的忘却方法在实际中无法实现真正的忘却。具体而言,尽管在确定性(贪心)解码下对这些 `已忘却' 模型的评估常常表明通过标准基准测试成功地移除了知识,但我们表明,在模型被采样使用标准概率解码时,敏感信息可靠地会重新浮现。为严格捕捉这一漏洞,我们引入了 `leak@' 这一新型元评估指标,用于量化在现实解码策略下生成模型 个样本时,已被遗忘知识重新出现的概率。使用三个广泛采用的基准测试,TOFU、MUSE 和 WMDP,我们进行了首次大规模、系统性的 `leak@' 指标忘却可靠性研究。我们的发现表明,知识泄漏在不同方法和任务之间仍然持续存在,凸显当前最先进 (SOTA) 忘却技术仅提供有限的忘却效果。我们提出一种算法,称为在 `leak@' 指标下稳健忘却 (`RULE',Robust Unlearning under LEak@ metric),以解决这一关切。我们展示,`RULE' 在 TOFU 基准测试下提供的已忘却模型在大量生成样本数方面没有信息泄漏。在 MUSE 基准测试上,`RULE' 在大多数采样预算 下的 `leak@' 指标上超越了 SOTA 忘却方法。代码已公开于 https://github.com/OptimAI-Lab/Leak-k。
引用
@article{arxiv.2511.04934,
title = {Leak@$k$: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding},
author = {Hadi Reisizadeh and Jiajun Ruan and Yiwei Chen and Soumyadeep Pal and Sijia Liu and Mingyi Hong},
journal= {arXiv preprint arXiv:2511.04934},
year = {2026}
}