SafeNeuron:面向大语言模型的神经元级安全对齐
机器学习
2026-02-13 v1
摘要
大语言模型(LLM)及多模态 LLM 通常在发布前进行安全对齐,以防止生成有害内容。然而,近期研究表明安全行为集中于少数参数子集中,使得对齐脆弱且易通过神经元级攻击被绕过。此外,大多数现有对齐方法 operate 在行为层面,无法对模型内部安全机制提供有限的控制。本文提出 SafeNeuron,一种神经元级安全对齐框架,通过在网络中重新分配安全表示来提高鲁棒性。SafeNeuron 首先识别与安全相关的神经元,然后在偏好优化期间冻结这些神经元,以防止依赖稀疏的安全通路并迫使模型构建冗余的安全表示。广泛的实验在不同模型和模态上表明,SafeNeuron 在抗神经元剪枝攻击方面显著提高鲁棒性,降低了开源模型被用作红队生成器的风险,同时保持了通用能力。此外,我们的层级分析揭示,安全行为由稳定且共享的内部表示支配。总体而言,SafeNeuron 提供了一个可解释且稳健的对齐视角。
引用
@article{arxiv.2602.12158,
title = {SafeNeuron: Neuron-Level Safety Alignment for Large Language Models},
author = {Zhaoxin Wang and Jiaming Liang and Fengbin Zhu and Weixiang Zhao and Junfeng Fang and Jiayi Ji and Handing Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2602.12158},
year = {2026}
}