中文

SafeSeek:语言模型中安全回路的通用归因

机器学习 2026-03-25 v1 人工智能

摘要

机制可解释性揭示了大语言模型(LLM)中的安全关键行为(例如,对齐、越狱、后门)植根于专门的功能组件。然而,现有的安全归因方法由于依赖启发式的、特定领域的指标和搜索算法,在泛化和可靠性方面存在困难。为了解决这个问题,我们提出了 SafeSeek,一个统一的安全可解释性框架,通过优化识别 LLM 中功能完整的安全回路。与关注孤立头或神经元的方法不同,SafeSeek 引入可微二值掩码,通过在安全数据集上进行梯度下降来提取多粒度回路,同时集成安全回路调优,以利用这些稀疏回路进行高效的安全微调。我们在 LLM 安全的两个关键场景中验证了 SafeSeek:\textbf{(1) 后门攻击},识别出一个稀疏度为 0.42\% 的后门回路,其消融将攻击成功率(ASR)从 100\% 降至 0.4\%,同时保留了超过 99\% 的通用效用;\textbf{(2) 安全对齐},定位了一个包含 3.03\% 头和 0.79\% 神经元的对齐回路,其移除使 ASR 从 0.8\% 飙升至 96.9\%,而在有用性微调期间排除此回路则保持了 96.5\% 的安全保留率。

关键词

引用

@article{arxiv.2603.23268,
  title  = {SafeSeek: Universal Attribution of Safety Circuits in Language Models},
  author = {Miao Yu and Siyuan Fu and Moayad Aloqaily and Zhenhong Zhou and Safa Otoum and Xing fan and Kun Wang and Yufei Guo and Qingsong Wen},
  journal= {arXiv preprint arXiv:2603.23268},
  year   = {2026}
}