中文

SCAN:稀疏电路锚定可解释神经元的持续知识编辑

人工智能 2026-03-17 v1

摘要

大型语言模型(LLMs)在顺序知识编辑过程中常常出现灾难性遗忘和崩溃。这种脆弱性源于现有稠密编辑范式将模型视为黑箱,并依赖粗粒度参数干预,这些干预不可避免地破坏了保存的知识。为此,我们提出了SCAN(稀疏电路锚定神经元的稀疏编辑框架),将编辑转化为基于稀疏 Transcoder 构建知识电路的机制感知操作。实验在 Gemma2、Qwen3 和 Llama3.1 上进行,分别使用 CounterFact、ZsRE 和 WikiFactDiff。我们证明SCAN在保持模型完整性方面优于现有方法,在MMLU和GSM8K等基准测试上即使经过3000次顺序编辑后仍保持稳定,而其他方法则随编辑累积而逐渐恶化,最终导致模型崩溃。

关键词

引用

@article{arxiv.2603.15226,
  title  = {SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing},
  author = {Yuhuan Liu and Haitian Zhong and Xinyuan Xia and Qiang Liu and Shu Wu and Liang Wang},
  journal= {arXiv preprint arXiv:2603.15226},
  year   = {2026}
}

备注

21pages, 7figures