Sockpuppetting:结合预填充与优化的 LLM 越狱攻击
计算与语言
2026-05-14 v2 密码学与安全
机器学习
摘要
预填充攻击是一种有效且低成本的 LLM 越狱方法,它直接在 LLM 输出的开头插入一段接受序列(例如“Sure, here is how to...”),并引导模型继续生成回复。我们在现有工作基础上做出了两项贡献。首先,我们展示了非复杂的攻击者可以通过集成少量预填充变体来改进众所周知的预填充攻击。运行三种易于生成的预填充变体,在 Gemma-7B、Llama-3.1-8B 和 Qwen3-8B 上分别获得了 22%、90% 和 99% 的组合攻击成功率(ASR),比标准的“Sure, here's...”预填充攻击提高了最多 38%,比我们复现的 GCG(Zou et al., 2023)提高了最多 82%。其次,我们引入了“sockpuppetting”,这是一种混合攻击,它优化放置在聊天模板的“assistant”消息块内部而非用户提示中的对抗性后缀。该攻击的滚动变体 RollingSockpuppetGCG 在 Llama-3.1-8B 上比我们的通用 GCG 基线将提示无关的 ASR 提高了最多 64%。这两项发现均强调了在开放权重模型中防御输出前缀注入的必要性。代码:https://gitlab.com/asendotsinski/sockpuppetting
引用
@article{arxiv.2601.13359,
title = {Sockpuppetting: Jailbreaking LLMs by Combining Prefilling with Optimization},
author = {Asen Dotsinski and Panagiotis Eustratiadis},
journal= {arXiv preprint arXiv:2601.13359},
year = {2026}
}
备注
13 pages, 6 figures