中文

智能体即大语言模型遗忘所需的一切

人工智能 2025-07-09 v2 计算与语言

摘要

在大语言模型(LLM)中移除或抑制信息是一项理想的功能,可用于AI监管、法律合规、安全和隐私保护。LLM遗忘方法旨在按需从LLM中移除信息。由于遗忘效果和模型效用这两个目标相互竞争,当前的LLM遗忘方法难以在两者之间取得平衡。在不假设能访问模型权重的情况下,保持遗忘过程计算可行是一个被忽视的领域。在这项工作中,我们表明,对于有效且实用的推理时LLM遗忘,智能体可能就是我们所需的一切。我们提出了首个基于智能体的LLM遗忘(ALU)方法,这是一种多智能体、免重新训练、与模型无关的LLM遗忘方法,能在保持有用性的同时实现有效遗忘。我们的ALU框架通过引入多个LLM智能体来实现遗忘,每个智能体都针对遗忘过程中的特定步骤而设计,无需更新框架中任何智能体的模型权重。用户可以轻松地以任意顺序请求任意一组遗忘实例,而ALU能实时无缝适应。这无需对底层LLM模型进行任何更改。通过在已建立的基准(TOFU、WMDP、WPU)和越狱技术(多次提示、目标掩码、其他语言)上的广泛实验,我们证明ALU在当前最先进的推理时LLM遗忘框架中始终表现最为稳健,同时其时间成本与遗忘目标的数量基本无关,保持恒定。我们进一步强调了ALU在大规模评估时相较于现有方法的优越性能。具体而言,ALU在多达1000个遗忘目标上进行了评估,超出了所有先前提出的LLM遗忘方法的评估范围。

关键词

引用

@article{arxiv.2502.00406,
  title  = {Agents Are All You Need for LLM Unlearning},
  author = {Debdeep Sanyal and Murari Mandal},
  journal= {arXiv preprint arXiv:2502.00406},
  year   = {2025}
}

备注

Accepted to COLM 2025