中文

面向大语言模型安全关键参数的识别与干预

密码学与安全 2026-04-10 v1

摘要

确保大语言模型(LLM)安全至关重要,但由于缺乏对安全机制的清晰理解,便阻碍了开发精确可靠的安全干预方法。为更好地理解和控制LLM安全,我们提出了预期安全影响(Expected Safety Impact, ESI)框架,用于量化不同参数对LLM安全的影响。基于ESI,我们揭示了不同LLM架构中存在不同的安全关键模式:在稠密LLM中,许多安全关键参数位于值矩阵(V)和中层的MLP中,而在混合专家(Mixture-of-Experts, MoE)模型中,这些参数则转移到后期层的MLP中。利用ESI,我们进一步引入两种针对性的干预范式,即安全强化调谐(Safety Enhancement Tuning, SET)和安全保护适应(Safety Preserving Adaptation, SPA)。SET可通过仅更新少量安全关键参数来对齐不安全的LLM,在保持原有性能的同时有效提升安全性。SPA则通过防止安全关键权重被破坏,在能力导向干预(如指令调谐)期间保护已对齐的LLM,使其能够获取新能力并维持安全能力。对不同LLM进行大规模评估显示,SET仅需对1%的模型权重进行100次迭代,即可将不对齐LLM的攻击成功率降低超过50%。SPA在进行不同任务上的1000次指令微调后,可将对齐LLM的安全性能损失限制在1%以内。我们的代码已公开:https://github.com/ZJU-LLM-Safety/SafeWeights-ACL。

关键词

引用

@article{arxiv.2604.08297,
  title  = {Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models},
  author = {Weiwei Qi and Zefeng Wu and Tianhang Zheng and Zikang Zhang and Xiaojun Jia and Zhan Qin and Kui Ren},
  journal= {arXiv preprint arXiv:2604.08297},
  year   = {2026}
}

备注

20 pages, 6 figures, 8 tables