中文

面向微调大语言模型的多层级安全持续投影(无需重训练)

机器学习 2026-02-02 v4 人工智能

摘要

尽管微调服务推动了大语言模型(LLM)任务能力的快速扩展,但其往往伴随着安全对齐表示的退化与重组,使得模型更易偏离人类偏好,并暴露于新兴的越狱风险之中。现有的微调后防御方法主要依赖单一尺度的安全修正机制,难以在安全性、模型效用和持续适应性之间取得稳健的平衡。我们提出了多层级安全持续投影(MSCP),这是一种免训练的微调后安全增强方法,通过协调多层级表示来隐式对齐全局和局部安全激活,以隔离控制安全敏感行为的稀疏神经元簇。该方法随后在不重训练的情况下应用可组合的安全方向投影,在最小化参数扰动的同时有效抑制有害输出,并保持任务性能及提升与人类偏好的对齐。在多个微调LLM上的广泛实验表明,我们的方法在仅进行最小参数修改的情况下,显著降低了有害性得分和攻击成功率,同时保持了模型的效用。此外,我们引入了一种任务特定的多维异构安全激活聚类机制,使模型具备针对不可预见新兴安全问题的持续防御与泛化能力。

关键词

引用

@article{arxiv.2508.09190,
  title  = {Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining},
  author = {Bing Han and Feifei Zhao and Dongcheng Zhao and Guobin Shen and Ping Wu and Yu Shi and Yi Zeng},
  journal= {arXiv preprint arXiv:2508.09190},
  year   = {2026}
}