中文

超越拒绝与表示子空间:对对齐 LLM 中任务条件拒绝的机制分析

计算与语言 2026-05-29 v3

摘要

经过对齐训练以拒绝有害请求的语言模型也表现出超范围拒绝现象:它们会拒绝看似类似于有害请求的安全指令。一种自然的做法是削弱全局拒绝方向,将隐藏状态向量向或远离有害拒绝示例,以此引导,但这种做法仅偶然纠正超范围拒绝,同时会扰乱更广泛的拒绝机制。在本文中,我们分析了两种拒绝类型的表示几何,以理解为何会发生这种情况。我们表明,有害拒绝方向是任务无关的,可以被捕获为单个全局向量,而超范围拒绝方向是任务相关的:它们位于良好任务表示簇内部,跨任务变化,形成更高维的子空间。线性探测表明,这两种拒绝类型在转换器的早期层中是表示上不同的。这些发现提供了为何仅通过全局方向消除无法解决超范围拒绝的机制解释,并建立了任务特定几何干预是必要的。

关键词

引用

@article{arxiv.2603.27518,
  title  = {Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs},
  author = {Utsav Maskey and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2603.27518},
  year   = {2026}
}

备注

Preprint