中文

大语言模型中的精确参数内概念擦除

计算与语言 2025-10-30 v2

摘要

大语言模型(LLM)在预训练期间通常会获取在下游部署中不受欢迎的知识,例如敏感信息或受版权保护的内容。用于移除此类知识的现有方法依赖于微调、训练低秩适配器或事实级编辑,但这些方法要么过于粗糙、要么过于浅层,要么无效。在这项工作中,我们提出了 PISCES(Precise In-parameter Suppression for Concept EraSure,用于概念擦除的精确参数内抑制),这是一种新颖的框架,通过直接编辑参数空间中编码概念的方向来从模型参数中精确擦除整个概念。PISCES 使用解耦器模型将 MLP 向量分解为可解释的特征,利用自动化可解释性技术识别与目标概念相关的特征,并将其从模型参数中移除。在 Gemma 2 和 Llama 3.1 上针对各种概念的实验表明,PISCES 在有效性上比领先的擦除方法取得了适度提升,将目标概念上的准确率降至最低 7.7%,同时显著提高了擦除特异性(高达 31%)和鲁棒性(高达 38%)。总体而言,这些结果表明,基于特征的参数内编辑为移除语言模型中的概念知识提供了一种更精确、更可靠的方法。

关键词

引用

@article{arxiv.2505.22586,
  title  = {Precise In-Parameter Concept Erasure in Large Language Models},
  author = {Yoav Gur-Arieh and Clara Suslik and Yihuai Hong and Fazl Barez and Mor Geva},
  journal= {arXiv preprint arXiv:2505.22586},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference