中文

在大型语言模型中构造可逆的 SFT 行为

机器学习 2026-05-08 v1

摘要

监督微调 (SFT) 在大型语言模型中引入了新的行为,但并未对这些行为在模型内的分布方式施加结构性约束。现有的行为解释方法,如回路归因方法,是事后识别与 SFT 诱导行为相关的稀疏子网络。然而,这种相关性并不意味着因果必要性,从而限制了在推理时选择性控制 SFT 诱导行为的能力。我们寻求一种替代方案并提出问题:能否将 SFT 诱导的行为刻意压缩到一个稀疏的、机制上必要的子网络(称为载体)中,同时在推理时无需修改权重即可保持可控性?我们提出了 (a) 损失受限双重下降 (LCDD),它通过在显式效用预算下联合优化路由掩码和模型权重来构建此类载体;以及 (b) SFT-Eraser,这是一种通过对提取的载体通道进行激活匹配而优化的软提示,用于逆转 SFT 诱导的行为。在多个模型族的安全、固定响应和风格行为上,LCDD 生成的稀疏载体不仅保留了目标行为,还能在 SFT-Eraser 触发时实现强逆转。消融实验进一步证实,稀疏结构是逆转的关键前提:相同的触发优化在标准 SFT 模型上会失败,这证实了结构而非触发设计才是起作用的因素。这些结果提供了直接证据,表明学习到的载体对行为具有因果必要性,为在部署模型中系统性地定位和选择性抑制 SFT 诱导行为指明了新方向。

关键词

引用

@article{arxiv.2605.06632,
  title  = {Crafting Reversible SFT Behaviors in Large Language Models},
  author = {Yuping Lin and Pengfei He and Yue Xing and Yingqian Cui and Jiayuan Ding and Subhabrata Mukherjee and Hui Liu and Zhen Xiang},
  journal= {arXiv preprint arXiv:2605.06632},
  year   = {2026}
}