Tempest: 基于树搜索的大语言模型自主多轮越狱
人工智能
2025-05-29 v5 计算与语言
密码学与安全
摘要
我们介绍Tempest,这是一种多轮对抗框架,从树搜索视角模拟大语言模型(LLM)安全性逐步削弱的过程。不同于依赖单轮精心设计提示词的单轮越狱,Tempest以宽度优先的方式在每一轮对话中扩展,生成多个利用前序响应部分合规性的对抗性提示。通过跟踪这些渐进式政策泄漏并重新注入后续查询,Tempest揭示了微小让步如何累积成完全不允许的输出。针对JailbreakBench数据集的评估显示,Tempest在GPT-3.5-turbo上实现100%成功率,在GPT-4上达97%成功率,且查询次数少于Crescendo或GOAT等基线方法。这种树搜索方法提供了模型安全防御在连续对话轮次中逐步退化的深入视角,凸显了针对语言模型进行稳健多轮测试的紧迫性。
引用
@article{arxiv.2503.10619,
title = {Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search},
author = {Andy Zhou and Ron Arel},
journal= {arXiv preprint arXiv:2503.10619},
year = {2025}
}
备注
Accepted to ACL 2025 Main