中文

语言模型权重中的信息是否被遗忘方法移除?

机器学习 2025-02-10 v3

摘要

大型语言模型(LLM)对执行网络安全攻击、制造生物武器以及操纵人类的知识措施风险。以往的工作提出了遗忘此类知识的方法。历史上,人们一直不清楚遗忘技术是否从模型权重中实际移除信息,或者仅仅使其更难以访问。为消除这两个目标之间的差异,我们提出一种对抗评估方法,用于测试模型权重中信息是否被移除:我们提供一些原本应被遗忘的事实,并让攻击者利用这些事实尝试从同一分布中恢复其他无法从可访问事实推断出的事实。我们表明,对当前遗忘方法在预训练期间学习到的信息进行微调后,可恢复 88% 的遗忘前准确率,这揭示了这些方法在从模型权重中移除信息方面的局限性。我们的结果还表明,测量遗忘期间学习到的信息遗忘鲁棒性的遗忘评估,可能会高估相对于尝试遗忘预训练期间学习到的信息的遗忘鲁棒性。

关键词

引用

@article{arxiv.2410.08827,
  title  = {Do Unlearning Methods Remove Information from Language Model Weights?},
  author = {Aghyad Deeb and Fabien Roger},
  journal= {arXiv preprint arXiv:2410.08827},
  year   = {2025}
}