中文

ZeroUnlearn:大型语言模型的少样本知识消除

机器学习 2026-05-21 v2 人工智能 计算与语言

摘要

大型语言模型不可避免地保留来自大规模网络语料库的敏感信息,定义为可能引发有害生成的输入,引发隐私和安全方面的顾虑。现有的机器消除方法主要依赖重新训练或激进微调,这些方法要么计算成本高,要么容易降低相关知识和整体模型实用性。在本工作中,我们将机器消除重新表述为精确的知识重新映射问题,通过模型编辑实现。我们提出了 ZeroUnlearn,一个少样本消除框架。它通过将敏感输入映射到中性目标状态并删除其原始表示来覆盖这些输入。ZeroUnlearn 通过一种带有闭式解的乘性参数更新来强制表示正交,从而实现高效且有针对性的消除。我们进一步将 ZeroUnlearn 扩展为基于梯度的变体,用于多样本消除。实验表明,我们的方法在保持一般模型实用性的同时超越了现有基线。我们的代码已在 github 上提供:https://github.com/XMUDeepLIT/ZeroUnlearn。

关键词

引用

@article{arxiv.2605.18879,
  title  = {ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models},
  author = {Yujie Lin and Chengyi Yang and Zhishang Xiang and Yiping Song and Jinsong Su},
  journal= {arXiv preprint arXiv:2605.18879},
  year   = {2026}
}