中文

大语言模型越狱成功的最小、局部、因果解释

人工智能 2026-05-04 v1

摘要

安全训练的大型语言模型(LLMs)可以通过越狱提示诱导其回答有害请求。由于我们缺乏对LLMs为何易受越狱攻击的稳健理解,未来的前沿模型在更自主、更高风险的环境中可能同样容易受到此类攻击。先前的工作通过检查模型中间表示,识别编码有害性和拒绝概念的方向,从而将所有越狱攻击全球性地解释为试图降低或强化这些概念(例如,降低有害性)。然而,不同的越狱策略可能通过强化或抑制不同的中间概念来成功,而相同的越狱策略对不同的有害请求类别(例如暴力与网络攻击)可能无效;因此,我们寻求提供局部解释——即,为何这一特定越狱成功?为此,我们引入LOCA方法,通过识别导致特定越狱请求拒绝的最小可解释中间表示变化集合,给出越狱成功的局部、因果解释。我们在Gemma和Llama聊天模型上,从大型越狱基准测试中挑选的有害原-越狱配对进行评估,比较针对此场景调整的先前方法。LOCA通过进行平均六次可解释性变化即可成功诱导拒绝,而先前方法即使进行20次更改也常常无法实现拒绝。LOCA是对LLMs越狱成功进行机制学、局部解释的一步。代码将发布。

关键词

引用

@article{arxiv.2605.00123,
  title  = {Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models},
  author = {Shubham Kumar and Narendra Ahuja},
  journal= {arXiv preprint arXiv:2605.00123},
  year   = {2026}
}

备注

Pre-print