中文

全局策略,局部适应:具有双层学习的多轮红队测试代理

人工智能 2025-04-03 v1

摘要

随着大语言模型(LLM)变得愈发强大和普及,利用它们进行恶意攻击会带来重大的安全风险。尽管现有的大多数红队测试框架侧重于单轮攻击,但现实中的攻击者通常采用多轮方式,迭代地探测漏洞并根据威胁模型的响应调整其提示。在本文中,我们提出了\AlgName,一种新颖的多轮红队测试代理,它通过互补的学习维度模拟复杂的人类攻击者:全局策略学习(随时间积累知识并泛化到新的攻击目标)和局部提示学习(在初始尝试失败时针对特定目标细化实现)。与以往依赖固定策略集的多轮方法不同,\AlgName使代理能够识别新的越狱策略,建立基于目标的策略选择框架,并为所选策略细化提示表述。在JailbreakBench上的实证评估表明,我们的框架性能优越,在与GPT-3.5-Turbo和Llama-3.1-70B的5轮对话内实现了超过90%的攻击成功率,优于最先进的基线方法。这些结果凸显了动态学习在现实多轮场景中识别和利用模型漏洞的有效性。

关键词

引用

@article{arxiv.2504.01278,
  title  = {Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning},
  author = {Si Chen and Xiao Yu and Ninareh Mehrabi and Rahul Gupta and Zhou Yu and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2504.01278},
  year   = {2025}
}