中文

大语言模型通过量化解除忘记: catastrophic failure of LLM unlearning via quantization

计算与语言 2025-03-24 v3 人工智能

摘要

大语言模型(LLMs)在通过广泛的文本语料进行训练后展现出惊人的文本生成能力,但它们也可能从训练数据的多样性和敏感性中获取到不希望获得的行为,包括侵犯版权和私有内容。机器忘记技术被提出作为一种可行解决方案,用于在无需昂贵且耗时的再训练的情况下移除此类问题性内容的影响。该过程旨在在尽可能保留模型实用性的同时擦除特定知识。尽管当前的忘记技术有效,但很少有人关注现有的LLM忘记方法是否真正实现了遗忘,或者仅仅隐藏了知识,而当前的忘记基准测试无法检测这种现象。本文揭示了对已完成忘记处理的模型应用量化后,能够恢复“被遗忘”的信息。为全面评估这一现象,我们使用各种量化技术进行了在多个精度水平上的全面实验。我们发现,对于具有实用性约束的忘记方法,忘记后的模型在全精度下保留了平均21%的原本被遗忘的知识,而在4位量化后显著增加到83%。我们的代码可在\href{https://github.com/zzwjames/FailureLLMUnlearning}{https://github.com/zzwjames/FailureLLMUnlearning}获取。

关键词

引用

@article{arxiv.2410.16454,
  title  = {Catastrophic Failure of LLM Unlearning via Quantization},
  author = {Zhiwei Zhang and Fali Wang and Xiaomin Li and Zongyu Wu and Xianfeng Tang and Hui Liu and Qi He and Wenpeng Yin and Suhang Wang},
  journal= {arXiv preprint arXiv:2410.16454},
  year   = {2025}
}

备注

ICLR 2025