中文

探索大语言模型对抗后缀迁移性的理解

计算与语言 2025-10-28 v1 人工智能

摘要

基于离散优化的大型语言模型攻击旨在生成简短且毫无意义的后缀缀,当追加到输入提示后即可激发不允许的内容。值得注意的是,这些后缀往往具有可迁移性——即成功攻击从未优化过的提示和模型。尽管迁移性令人惊讶且已被实证证实,但该领域缺乏对何时何地以及为何发生迁移的严格分析。为填补这一空白,我们识别出三个统计属性与众多实验环境下的迁移成功率密切相关:(1) 在无后缀缀的提示下激活模型内部拒绝方向的程度;(2) 后缀缀对推远该方向的强度;(3) 这些位移在拒绝方向正交方向上的大小。相比之下,我们发现提示语义相似性仅与迁移成功率呈弱相关。这些发现促进了对迁移性的更细致理解,我们利用此统计分析进行干预实验,展示其如何转化为对攻击成功率的实际性质改进。

关键词

引用

@article{arxiv.2510.22014,
  title  = {Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models},
  author = {Sarah Ball and Niki Hasrati and Alexander Robey and Avi Schwarzschild and Frauke Kreuter and Zico Kolter and Andrej Risteski},
  journal= {arXiv preprint arXiv:2510.22014},
  year   = {2025}
}