SIRAJ:基于蒸馏结构化推理实现LLM代理的多样性与高效红队测试
密码学与安全
2025-10-31 v1 人工智能
计算与语言
摘要
LLM代理的计划与工具调用能力暴露了新的安全风险,使得全面的红队测试系统对于发现漏洞和确保安全部署至关重要。我们提出SIRAJ:一个面向任意黑箱LLM代理的通用红队框架。我们采用动态两步过程:首先从代理定义生成覆盖various风险结果、工具使用轨迹和风险来源的多样化初始测试用例;然后基于前几次尝试的执行轨迹,迭代构建和细化基于模型的对抗攻击。为优化红队测试成本,我们提出模型蒸馏方法,利用教师模型的结构化推理形式来训练规模更小的模型,使其同样有效。在多样化的评估代理设置下,我们的初始测试用例生成方法可提高风险结果和工具调用轨迹的覆盖率提升2--2.5倍。我们的蒸馏8B红队模型在攻击成功率上提升了100%,超越了671B的Deepseek-R1模型。我们的消融实验和分析验证了迭代框架、结构化推理以及红队模型普适性的有效性。
引用
@article{arxiv.2510.26037,
title = {SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning},
author = {Kaiwen Zhou and Ahmed Elgohary and A S M Iftekhar and Amin Saied},
journal= {arXiv preprint arXiv:2510.26037},
year = {2025}
}