中文

LLM遗忘应独立于表达形式

计算与语言 2025-06-10 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)遗忘旨在擦除或抑制模型中的不良知识,为控制有害或私密信息以防止滥用提供了可能性。然而,近期研究揭示了其在现实场景中的有限有效性,阻碍了实际应用。在本研究中,我们识别出许多下游失败的普遍问题:现有遗忘方法的有效性严重依赖于训练样本的形式,并且经常无法泛化到同一知识的不同表达形式。我们将这一问题形式化地表征为形式依赖偏差(Form-Dependent Bias),并系统地研究了其在各种下游任务中的具体表现模式。为量化其普遍性并支持未来研究,我们引入了ORT——一个旨在评估遗忘方法对知识表达变化的鲁棒性的新型基准。结果表明,形式依赖偏差在当前技术中既普遍又严重。我们认为,LLM遗忘应独立于表达形式,以应对现实安全关键场景中遇到的下游任务的无限形式。为实现这一目标,我们提出了秩一概念重定向(ROCR),一种新颖的无训练方法,作为有前景的解决路径。ROCR通过针对下游任务中的不变量——具体而言是被激活的危险概念——来执行遗忘。它能够在数秒内修改模型参数,将模型对特定遗忘目标概念的感知重定向到另一个无害概念。大量实验表明,ROCR相较于传统方法显著提升了遗忘有效性,同时生成高度自然的输出。

关键词

引用

@article{arxiv.2506.07795,
  title  = {LLM Unlearning Should Be Form-Independent},
  author = {Xiaotian Ye and Mengqi Zhang and Shu Wu},
  journal= {arXiv preprint arXiv:2506.07795},
  year   = {2025}
}