通过耦合权重与激活约束防止大语言模型安全漂移
人工智能
2026-04-15 v1
摘要
大语言模型(LLM)的安全对齐在微调过程中极其脆弱,甚至连无害的适配也会损坏预训练的拒绝行为,导致有害响应。现有防御措施通常仅约束权重或激活,缺乏对二者在安全方面的耦合效应的考虑。本文首先从理论上证明,仅约束权重或激活单独不足以实现安全保护。为稳健保留安全对齐,我们提出耦合权重与激活约束(CWAC)的新方法,同时对权重更新施加预计算的安全子空间约束,并针对稀疏自编码器识别的安全关键特征应用定向正则化。广泛实验表明,在四种主流 LLM 上以及多样化的下游任务中,CWAC 在保持最低有害得分的同时,对微调准确率影响微小,显著优于强基准,即便在高有害数据比例下也同样表现出色。
引用
@article{arxiv.2604.12384,
title = {Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints},
author = {Songping Peng and Zhiheng Zhang and Daojian Zeng and Lincheng Jiang and Xieping Gao},
journal= {arXiv preprint arXiv:2604.12384},
year = {2026}
}
备注
17 pages, 6 figures, 6 tables, The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)