UniErase:面向语言模型的平衡且精确的忆忏
计算与语言
2025-09-29 v2 人工智能
摘要
大型语言模型(LLMs)需要不断更新以解决过时信息问题,其中 LLM 忆忏提供了选择性删除的一种方法。然而,主流的忆忏方法主要依赖微调技术,往往在精准的目标忆忏方面缺乏精度,并且在大规模和顺序设置下难以在忆忏效果与通用能力之间取得平衡。为弥合这一差距,本文我们引入了 UniErase,这是一个展现出精准性和在知识忆忏与能力保留之间实现平衡性能的新型忆忏框架。我们首先提出了忆忏标记(Unlearning Token),该标记经过优化以引导 LLMs 进入忆忏空间。为实现具体的忆忏行为,我们进一步引入了轻量级忆忏编辑(Unlearning Edit),高效地将忆忏目标与该元标记关联。作为一种通过编辑实现的新型忆忏范式,UniErase 在批处理、顺序和精确忆忏任务中展现出卓越的性能,适用于虚构场景和真实世界情景。在 TOFU 数据集上,与 8 个基线方法相比,UniErase 只修改约 3.66% 的 LLM 参数,即可将前所未有的忆忏基线方法在模型能力方面提高约 4.01 倍,同时实现更高的忆忏效果。同样地,UniErase 在 ability retention 方面表现更佳,也将前所未有的保留方法在忆忏效果上提高了 35.96%,在当前忆忏社区中展现出在平衡和双顶级性能方面的卓越表现。
引用
@article{arxiv.2505.15674,
title = {UniErase: Towards Balanced and Precise Unlearning in Language Models},
author = {Miao Yu and Liang Lin and Guibin Zhang and Xinfeng Li and Junfeng Fang and Xingrui Yu and Ivor Tsang and Ningyu Zhang and Kun Wang and Yang Wang},
journal= {arXiv preprint arXiv:2505.15674},
year = {2025}
}