中文

让蜜蜂找到弱点:基于多轮越狱攻击的路径规划视角

密码学与安全 2025-11-06 v1 计算与语言

摘要

大型语言模型(LLMs)已在各类应用中广泛部署,但其潜在安全和伦理风险日益引人关注。现有研究采用红队评估,利用多轮越狱识别 LLMs 的潜在漏洞。然而,这些方法往往缺乏对攻击空间内成功对话轨迹的探索,同时忽视了攻击过程所需的显著开销。为此,本文首先引入基于动态加权图拓扑的理论模型,将多轮攻击过程抽象为路径规划问题。基于此框架,我们提出 ABC(增强型人工蜂群算法),用于多轮越狱,特点是包含雇佣蜂、观察蜂和探索蜂的协作搜索机制。该算法显著提高了最优攻击路径搜索的效率,大幅降低了所需查询次数。对三款开源和两款专有语言模型进行实证评估,表明我们方法有效,攻击成功率均超过 90%,GPT-3.5-Turbo 最高达 98%,且仅需 26 次查询即可实现相当的成功率,大幅降低了红队评估的开销,凸显了其卓越的效率。

关键词

引用

@article{arxiv.2511.03271,
  title  = {Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs},
  author = {Yize Liu and Yunyun Hou and Aina Sui},
  journal= {arXiv preprint arXiv:2511.03271},
  year   = {2025}
}