中文

提示中的哪些特征越狱了 LLMs?探究攻击背后的机制

密码学与安全 2025-11-04 v3 人工智能 计算与语言

摘要

越狱一直是大语言模型(LLMs)安全性和可靠性研究的核心焦点,但这些攻击背后的机制仍知之甚少。虽然以前的研究主要依赖线性方法来检测越狱尝试和模型拒绝,但我们采取了不同的方法,检查导致成功越狱的提示中的线性和非线性特征。首先,我们引入了一个新颖的数据集,包含 10,800 次越狱尝试,涵盖 35 种不同的攻击方法。利用该数据集,我们在开放权重 LLMs 的隐藏状态上训练线性和非线性探针以预测越狱是否成功。探针实现了很强的分布内准确率,但迁移具有攻击家族特异性,这表明不同的越狱由不同的内部机制支持,而不是单一的通用方向。为了建立因果相关性,我们构建了探针引导的潜在干预,在预测方向上系统地改变顺从性。源自非线性探针的干预比源自线性探针的干预产生更大且更可靠的效果,表明与越狱成功相关的特征在提示表示中是以非线性方式编码的。总体而言,结果揭示了越狱机制中异构的非线性结构,并提供了一种提示侧的方法,用于恢复和测试驱动越狱结果的特征。

关键词

引用

@article{arxiv.2411.03343,
  title  = {What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks},
  author = {Nathalie Kirch and Constantin Weisser and Severin Field and Helen Yannakoudakis and Stephen Casper},
  journal= {arXiv preprint arXiv:2411.03343},
  year   = {2025}
}