中文

跨 LLM 的通用拒绝电路:通过轨迹重放与概念基重建实现跨模型迁移

计算与语言 2026-01-27 v2

摘要

对齐后的大型语言模型(LLM)中的拒绝行为通常被视为模型特定的,但我们假设它源于一个跨模型共享的通用低维语义回路。为了验证这一点,我们引入了基于概念基重建的轨迹重放框架,该框架将拒绝干预从源模型迁移到目标模型,涵盖不同的架构(例如,Dense 到 MoE)和训练范式,且无需使用目标端的拒绝监督。通过概念指纹对齐层,并使用共享的概念原子“配方”重建拒绝方向,我们将源模型的消融轨迹映射到目标模型的语义空间中。为了保持模型能力,我们引入了一种权重-SVD 稳定性保护机制,将干预投影到远离高方差权重子空间的方向,以防止附带损害。我们在 8 对模型上的评估证实,这些迁移的配方能够持续减弱拒绝行为,同时保持性能,为安全对齐的语义通用性提供了有力证据。

关键词

引用

@article{arxiv.2601.16034,
  title  = {Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction},
  author = {Tony Cristofano},
  journal= {arXiv preprint arXiv:2601.16034},
  year   = {2026}
}