中文

通过耦合权重与激活约束防止大语言模型安全漂移

人工智能 2026-04-15 v1

摘要

大语言模型(LLM)的安全对齐在微调过程中极其脆弱,甚至连无害的适配也会损坏预训练的拒绝行为,导致有害响应。现有防御措施通常仅约束权重或激活,缺乏对二者在安全方面的耦合效应的考虑。本文首先从理论上证明,仅约束权重或激活单独不足以实现安全保护。为稳健保留安全对齐,我们提出耦合权重与激活约束(CWAC)的新方法,同时对权重更新施加预计算的安全子空间约束,并针对稀疏自编码器识别的安全关键特征应用定向正则化。广泛实验表明,在四种主流 LLM 上以及多样化的下游任务中,CWAC 在保持最低有害得分的同时,对微调准确率影响微小,显著优于强基准,即便在高有害数据比例下也同样表现出色。

关键词

引用

@article{arxiv.2604.12384,
  title  = {Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints},
  author = {Songping Peng and Zhiheng Zhang and Daojian Zeng and Lincheng Jiang and Xieping Gao},
  journal= {arXiv preprint arXiv:2604.12384},
  year   = {2026}
}

备注

17 pages, 6 figures, 6 tables, The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)