中文

语言模型的拒绝行为由单一方向决定

机器学习 2024-11-01 v3 人工智能 计算与语言

摘要

对话式大语言模型经过指令遵循和安全性微调,表现出对良性请求服从但拒绝有害请求的行为。尽管这种拒绝行为在聊天模型中广泛存在,但其背后的机制仍鲜为人知。本文我们发现,拒绝行为在13个主流开源聊天模型(参数规模最高达72B)中由一个一维子空间所主导。具体而言,对于每个模型,我们发现一个单一的方向,一旦从模型的残差流激活中擦除该方向,即可防止其拒绝有害指令;而添加该方向则会导致即使对无害指令也产生拒绝。借助这一洞察,我们提出一种新型白盒级攻击方法,通过精细性地禁用拒绝机制,几乎不影响其他能力。最后,我们机械性地分析了对抗性后缀如何抑制拒绝主导方向的传播。我们的发现凸显了当前安全微调方法的脆弱性。更广泛地说,我们的工作展示了如何通过理解模型内部机制来开发实际的模型行为控制方法。

关键词

引用

@article{arxiv.2406.11717,
  title  = {Refusal in Language Models Is Mediated by a Single Direction},
  author = {Andy Arditi and Oscar Obeso and Aaquib Syed and Daniel Paleka and Nina Panickssery and Wes Gurnee and Neel Nanda},
  journal= {arXiv preprint arXiv:2406.11717},
  year   = {2024}
}