SOM 多方向拒绝抑制:语言模型中的多方向拒绝机制
人工智能
2026-03-25 v2 机器学习
摘要
拒绝是指使安全对齐的语言模型拒绝有害或不道德提示的功能。紧随而来的是,对机制可解释性日益关注的趋势,最近的研究将拒绝行为编码为模型潜空间中单一方向;例如,计算为有害和无害提示表示质心之间的差异。然而,新兴证据表明,LLM 中的概念往往以嵌入在高维潜空间中的低维流形形式出现。以此为动机,我们提出了一种新方法,利用自组织地图 (Self-Organizing Maps, SOMs) 提取多个拒绝方向。为此,我们首先证明 SOMs 泛化了前期工作中的差分均值技术。随后,我们在有害提示表示上训练 SOMs 以识别多个神经元。通过从每个神经元的质心中减去无害表示的质心,我们推导出一组表达拒绝概念的多个方向。我们在广泛的实验设置中对方法进行了验证,表明从模型内部消除多个方向的效果,不仅优于单一方向基线,而且优于专门的越狱算法,从而有效抑制拒绝。最后,我们通过分析我们的方法的机制性含义作结。
引用
@article{arxiv.2511.08379,
title = {SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models},
author = {Giorgio Piras and Raffaele Mura and Fabio Brau and Luca Oneto and Fabio Roli and Battista Biggio},
journal= {arXiv preprint arXiv:2511.08379},
year = {2026}
}
备注
Accepted at AAAI 2026