在智能体时代重新定义 AI 红队测试:从数周缩短至数小时
人工智能
2026-05-06 v1 密码学与安全
摘要
AI 系统正进入医疗保健、金融和国防等关键领域,但仍然容易受到对抗性攻击。尽管 AI 红队测试是主要的防御手段,但当前的方法迫使操作人员采用手动的、特定于库的工作流程。操作人员花费数周时间手工构建工作流程——组装攻击、变换和评分器。当结果不理想时,必须重建工作流程。因此,操作人员构建工作流程的时间比探测目标的安全和安全性漏洞的时间还要多。我们引入了一个基于开源 Dreadnode SDK 构建的 AI 红队测试智能体。该智能体创建基于 45+ 种对抗性攻击、450+ 种变换和 130+ 种评分器的工作流程。操作人员可以探测多智能体系统、多语言和多模态目标,专注于探测什么而不是如何实现它。我们做出三项贡献:1. 智能体接口。操作人员通过 Dreadnode TUI(终端用户界面)用自然语言描述目标。该智能体处理攻击选择、变换组合、执行和报告,让操作人员专注于红队测试。数周时间压缩至数小时。2. 统一框架。一个用于探测传统 ML 模型(对抗样本)和生成式 AI 系统(越狱)的单一框架,无需单独的库。3. Llama Scout 案例研究。我们对 Meta Llama Scout 进行红队测试,在零人工编写代码的情况下实现了 85% 的攻击成功率,严重性最高达 1.0。
引用
@article{arxiv.2605.04019,
title = {Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours},
author = {Raja Sekhar Rao Dheekonda and Will Pearce and Nick Landers},
journal= {arXiv preprint arXiv:2605.04019},
year = {2026}
}
备注
39 pages, 8 figures