中文

进化方法而非提示:大语言模型越狱攻击的进化合成

计算与语言 2026-05-19 v2 密码学与安全

摘要

针对大语言模型(LLM)的自动化红队框架已变得日益复杂,但许多框架仍主要在提示空间中进行攻击优化。换句话说,这些方法主要搜索更好的攻击措辞或更好的策略选择,但它们不搜索可执行代码。通过将搜索转移到代码空间,我们不仅可以优化最终的攻击提示,还可以优化生成攻击提示的过程,包括执行流程、可重用逻辑、分支和故障驱动修复。为克服这一差距,我们引入了 EvoSynth,一个自主多智能体框架,它将优化空间从提示转移到可执行代码。EvoSynth 不直接优化提示,而是采用多智能体系统来自主设计、进化和执行基于代码的攻击算法。关键在于,它包含一个代码级自我修正循环,使其能够根据目标模型的反馈和失败的尝试,迭代地重写基于代码的算法。通过大量实验,我们证明 EvoSynth 对像 Claude-Sonnet-4.5 这样高度鲁棒的模型实现了 85.5% 的攻击成功率(ASR),在评估目标上的平均 ASR 达到 95.9%,同时生成的攻击比现有方法显著更多样化。我们发布我们的框架,以促进在可执行代码空间中进行进化合成的未来研究。

关键词

引用

@article{arxiv.2511.12710,
  title  = {Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs},
  author = {Yunhao Chen and Xin Wang and Juncheng Li and Yixu Wang and Jie Li and Yan Teng and Yingchun Wang and Xingjun Ma},
  journal= {arXiv preprint arXiv:2511.12710},
  year   = {2026}
}