中文

遗忘与混淆:我们真的在移除知识吗?

机器学习 2025-09-10 v2 人工智能

摘要

遗忘已成为大型语言模型(LLMs)支持数据隐私、法规遵从和伦理AI部署的一项关键能力。近期技术常依赖于通过注入错误或不相关信息来抑制知识的混淆方法。这类方法实际上构成了知识添加而非真正的移除,往往使模型易受探测攻击。本文中,我们正式区分了遗忘与混淆,并引入了一个基于探测的评估框架,以检验现有方法是否真正移除了目标信息。此外,我们提出了DF-MCQ,一种新颖的遗忘方法,该方法利用KL散度在自动生成的多项选择题上平坦化模型预测分布,有效移除关于目标个体的知识并触发恰当的拒绝行为。实验结果表明,DF-MCQ实现了超过90%拒绝率的遗忘效果,且在探测问题上达到了远高于混淆方法的随机选择级别的不确定性。

关键词

引用

@article{arxiv.2505.02884,
  title  = {Unlearning vs. Obfuscation: Are We Truly Removing Knowledge?},
  author = {Guangzhi Sun and Potsawee Manakul and Xiao Zhan and Mark Gales},
  journal= {arXiv preprint arXiv:2505.02884},
  year   = {2025}
}

备注

To Appear in EMNLP 2025 main conference