SCAN:稀疏电路锚定可解释神经元的持续知识编辑
人工智能
2026-03-17 v1
摘要
大型语言模型(LLMs)在顺序知识编辑过程中常常出现灾难性遗忘和崩溃。这种脆弱性源于现有稠密编辑范式将模型视为黑箱,并依赖粗粒度参数干预,这些干预不可避免地破坏了保存的知识。为此,我们提出了SCAN(稀疏电路锚定神经元的稀疏编辑框架),将编辑转化为基于稀疏 Transcoder 构建知识电路的机制感知操作。实验在 Gemma2、Qwen3 和 Llama3.1 上进行,分别使用 CounterFact、ZsRE 和 WikiFactDiff。我们证明SCAN在保持模型完整性方面优于现有方法,在MMLU和GSM8K等基准测试上即使经过3000次顺序编辑后仍保持稳定,而其他方法则随编辑累积而逐渐恶化,最终导致模型崩溃。
关键词
引用
@article{arxiv.2603.15226,
title = {SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing},
author = {Yuhuan Liu and Haitian Zhong and Xinyuan Xia and Qiang Liu and Shu Wu and Liang Wang},
journal= {arXiv preprint arXiv:2603.15226},
year = {2026}
}
备注
21pages, 7figures