单颗神经元足以绕过大语言模型的安全对齐
计算与语言
2026-05-12 v1 人工智能
机器学习
摘要
语言模型的安全对齐通过两种机制性不同系统运作:拒绝神经元控制有害知识是否被表达的门控机制,概念神经元编码有害知识本身。通过针对每个系统中的单个神经元,我们在横跨两个模型家族、参数规模从1.7B到70B的七个模型上,演示了两种失效方向——通过抑制绕过明确有害请求的安全防护,或通过放大诱导无害提示产生有害内容,且无需任何训练或提示工程。我们的发现表明,安全对齐并未在模型权重中稳健分布,而是通过每个神经元来调节拒绝行为——抑制其中一个被识别的拒绝神经元即可跨越多样有害请求绕过安全对齐。
引用
@article{arxiv.2605.08513,
title = {A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models},
author = {Hamid Kazemi and Atoosa Chegini and Maria Safi},
journal= {arXiv preprint arXiv:2605.08513},
year = {2026}
}