中文

GUARD:基于数据归因的引导式忘卸与保留

机器学习 2025-10-23 v2 人工智能 计算与语言

摘要

大型语言模型的忘卸正在因监管合规、版权保护和隐私 concerns 而日益重要。然而,LLM 忘卸的关键挑战之一是意外忘卸,即删除特定数据时不小心损害模型实用性及其保留有价值、期望信息的能力。虽然先前工作主要关注架构创新,但数据层次因素对忘卸性能的影响仍未得到充分探索。结果是,现有方法往往在忘卸高影响数据时表现出退化的保留性能。在本工作中,我们提出了 GUARD 框架,即 Guided Unlearning And Retention via Data attribution(基于数据归因的引导式忘卸与保留),以解决此问题。其核心,GUARD 引入一种针对 LLM 忘卸的轻量级代理数据归因指标,该指标衡量 Forget 与 Retain 集合之间的对齐程度,同时保持计算效率。基于此,我们设计了一种新的忘卸目标函数,为样本分配自适应、非均匀的忘卸权重,使其与其代理归因分数成反比。通过这种对忘卸力量的重新分配,GUARD 缓解了意外保留损失。我们还提供了严格的理论保证,表明 GUARD 在保持忘卸指标与先前方法相当的同时,显著提高了保留性能。在 TOFU 和 MUSE 基准上的大量实验表明,GUARD 在忘卸 10% 训练数据时,相对于先前方法,在 TOFU Retain Set 上减少了最高达 194.92% 的实用性牺牲,Truth Ratio 方面,在 MUSE NEWS Retain Set 上实现知识保留提升 16.20%,且在隐私损失方面与最先进方法相当或仅略有增加。

关键词

引用

@article{arxiv.2506.10946,
  title  = {GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models},
  author = {Peizhi Niu and Evelyn Ma and Huiting Zhou and Duo Zhou and Huan Zhang and S. Rasoul Etesami and Olgica Milenkovic},
  journal= {arXiv preprint arXiv:2506.10946},
  year   = {2025}
}