从安全神经元视角理解安全对齐:一种机制解释方法
计算与语言
2025-10-24 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 在各种能力方面表现出色,但即使在安全对齐后仍会产生有害内容和错误信息等安全风险。本文通过机制解释的视角探索了安全对齐的内部机制,侧重于识别和分析负责安全行为的安全神经元。我们提出推断时激活对比以定位这些神经元,并提出动态激活修补以评估其对模型安全的因果效应。来自多个流行 LLM 的实验表明,我们可一致识别约 的安全神经元,通过仅修补这些神经元的激活即可在各种红队基准测试中恢复超过 的安全性能,而不会影响通用能力。安全神经元的发现也有助于解释“对齐税”现象,揭示模型安全和有用性的关键神经元显著重叠,但它们需要相同的神经元具有不同的激活模式。此外,我们展示了将这些发现应用于保护 LLM 的用例,即在生成前检测不安全的输出。源代码可在 https://github.com/THU-KEG/SafetyNeuron 获取。
引用
@article{arxiv.2406.14144,
title = {Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons},
author = {Jianhui Chen and Xiaozhi Wang and Zijun Yao and Yushi Bai and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2406.14144},
year = {2025}
}
备注
NeurIPS 2025