中文

CRISP:基于稀疏自编码器的持久概念忘却

计算与语言 2026-04-28 v3

摘要

随着大型语言模型(LLM)在实际应用中的部署增多, selectively removing unwanted knowledge while preserving model utility 的需求日益重要。最近的研究探索了使用稀疏自编码器(SAE)对单语义特征进行精确干预。然而,大多数基于 SAE 的方法仅在推理时进行干预,无法在模型参数中创建持久性更改。此类干预可能被恶意操纵者通过参数访问所绕过或逆转。我们引入 CRISP,这是一种使用 SAE 实现持久概念忘却的参数高效方法。CRISP 自动识别跨多个层的显著 SAE 特征并抑制其激活。我们对两种 LLM 进行实验,表明该方法在来自 WMDP 框架的安全关键忘却任务中超越了先前方法,成功移除有害知识同时保留通用和领域内能力。特征级分析揭示,CRISP 实现了目标概念与良性概念之间语义上连贯的分离,允许精确抑制目标特征。

关键词

引用

@article{arxiv.2508.13650,
  title  = {CRISP: Persistent Concept Unlearning via Sparse Autoencoders},
  author = {Tomer Ashuach and Dana Arad and Aaron Mueller and Martin Tutek and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2508.13650},
  year   = {2026}
}

备注

Accepted to ACL 2026