中文

大型语言模型中拒绝的几何学:概念锥与表示独立性

机器学习 2026-02-10 v2 人工智能 计算与语言

摘要

大型语言模型的安全对齐可以通过对抗性构造的输入被规避,然而这些攻击绕过安全屏障的机制仍知之甚少。先前的工作表明,模型激活空间中的单一拒绝方向决定了 LLM 是否拒绝请求。在本研究中,我们提出了一种新颖的基于梯度的表示工程方法,并用它来识别拒绝方向。与先前的工作相反,我们发现了多个独立的方向,甚至调解拒绝的多维概念锥。此外,我们表明仅凭正交性并不意味着干预下的独立性,从而激发了同时考虑线性和非线性效应的表示独立性概念。使用这一框架,我们识别了机制上独立的拒绝方向。我们表明 LLM 中的拒绝机制受复杂空间结构支配,并识别了功能上独立的方向,证实了多种不同的机制驱动拒绝行为。我们基于梯度的方法揭示了这些机制,并可以进一步作为未来理解 LLM 工作的基础。

关键词

引用

@article{arxiv.2502.17420,
  title  = {The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence},
  author = {Tom Wollschläger and Jannes Elstner and Simon Geisler and Vincent Cohen-Addad and Stephan Günnemann and Johannes Gasteiger},
  journal= {arXiv preprint arXiv:2502.17420},
  year   = {2026}
}