Auto-RT:面向大型语言模型红队测试的自动越狱策略探索
密码学与安全
2025-01-06 v1 人工智能
计算与语言
摘要
自动化红队测试已成为发现大型语言模型 (LLMs) 漏洞的关键方法。然而,现有大多数方法侧重于孤立的安全缺陷,限制了其适应动态防御并高效发现复杂漏洞的能力。为应对这一挑战,我们提出了 Auto-RT,这是一个强化学习框架,能够自动探索并优化复杂的攻击策略,从而通过恶意查询有效地发现安全漏洞。具体而言,我们引入了两个关键机制以降低探索复杂度并改进策略优化:1) 提前终止探索,通过聚焦于高潜力攻击策略来加速探索;2) 结合中间降级模型的渐进式奖励跟踪算法,动态调整搜索轨迹以成功利用漏洞。在多种 LLMs 上的广泛实验表明,通过显著提升探索效率并自动优化攻击策略,Auto-RT 检测到了更广泛的漏洞,与现有方法相比实现了更快的检测速度和 16.63% 更高的成功率。
引用
@article{arxiv.2501.01830,
title = {Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models},
author = {Yanjiang Liu and Shuhen Zhou and Yaojie Lu and Huijia Zhu and Weiqiang Wang and Hongyu Lin and Ben He and Xianpei Han and Le Sun},
journal= {arXiv preprint arXiv:2501.01830},
year = {2025}
}