中文

基于子空间投影的解释性引导层选择:SAE 作为听诊器而非手术刀,用于原始任务向量模型编辑

机器学习 2026-05-28 v1 计算与语言

摘要

LLM 需要进行外科手术式的模型编辑以增强特定领域的能力,而不得不承受计算成本或灾难性遗忘的代价。稀疏自动编码器 (SAE) 作为一种在原则上允许在特征层面识别干预位置的有前景的工具。本文对 Gemma-3-4B-IT 上针对数学推理的 SAE 指导编辑管道进行严格评估,并发现其根本性失效模式:直观上令人信服的做法是将任务向量投影到 SAE 特征子空间,这会作为信息瓶颈丢弃约 97% 的修改能量,导致在七个数学科目中没有统计显著的改进。我们表明,这一失效源于激活空间 SAE 方向与权重空间任务向量之间的几何错位。我们随后提出一种视角转变:SAE 作为听诊器而非手术刀,在此意义上,SAE 用于层级诊断而非干预层面的过滤。通过仅注入经 SAE 推导的特定性得分识别的层中的未过滤的原始任务向量,我们将在 Minerva 数学基准测试中将 Number Theory 准确率从 29.6% 提升至 39.4% (z=+3.41, p=0.0007);七个数学科目中有五个显著性改进且没有显著性下降。该方法完全确定性,无需额外推理成本,并提供一种原则性的解释性引导模型编辑框架。

关键词

引用

@article{arxiv.2605.28649,
  title  = {Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing},
  author = {Li Lei and Madalina Ciobanu and Qingqing Mao and Ritankar Das},
  journal= {arXiv preprint arXiv:2605.28649},
  year   = {2026}
}