中文

手术式拒绝消融:通过概念引导的谱清洗将安全性与智能解耦

计算与语言 2026-01-14 v1

摘要

安全对齐的语言模型会系统性地拒绝有害请求。虽然激活引导可以调节拒绝行为,但消融由对比有害与无害提示计算出的原始“拒绝向量”通常会导致附带损害和分布漂移。我们认为这种退化发生是因为原始向量是多语义的,将拒绝信号与核心能力回路及语言风格纠缠在一起。我们引入了手术式拒绝消融(SRA)来蒸馏这些引导方向。SRA 构建了一个代表受保护能力和风格混淆的独立概念原子注册表,然后使用岭正则化谱残差化将拒绝向量与这些方向正交化。这产生了一个干净的拒绝方向,该方向针对与拒绝相关的结构,同时将对模型语义几何的破坏降至最低。在五个模型(Qwen3-VL 和 Ministral 系列)上,SRA 实现了深度的拒绝降低(0-2%),对 Wikitext-2 的困惑度影响可以忽略不计(平均 PPL 增量约为 0.02),且分布漂移极小。值得注意的是,在 Qwen3-VL-4B 上的标准消融会引起严重的漂移(首 token KL = 2.088),而 SRA 在实现相同 0% 拒绝率的同时保持了原始分布(KL = 0.044)。使用 GSM8K 和 MBPP 上的教师强制困惑度作为高分辨率能力代理,我们表明 SRA 保留了数学和代码分布。这些结果表明,常见的“模型损害”通常是“幽灵噪声”,定义为脏拒绝方向向能力子空间的谱泄漏。

关键词

引用

@article{arxiv.2601.08489,
  title  = {Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning},
  author = {Tony Cristofano},
  journal= {arXiv preprint arXiv:2601.08489},
  year   = {2026}
}