中文

RedTWIZ:通过自适应攻击规划实现多样化大语言模型红队测试

密码学与安全 2025-10-09 v1 计算与语言

摘要

本文提出了RedTWIZ框架的愿景、科学贡献与技术细节,这是一个自适应且多样化的多轮红队测试框架,用于审计大语言模型(LLM)在AI辅助软件开发中的鲁棒性。我们的工作由三个主要研究方向驱动:(1)对LLM对话式越狱的稳健且系统化评估;(2)支持构成性、真实且目标导向式越狱对话策略的多样化生成攻击套件;(3)层次化攻击规划器,自适应规划、序列化并触发针对特定LLM漏洞的攻击。这些贡献共同构成统一框架,集评估、攻击生成与战略规划于一体,全面评估并暴露LLM鲁棒性薄弱环节。进行大规模评估,系统评估与分析整体系统及各组件性能。实验结果表明,我们的多轮对抗性攻击策略成功导致领先LLM生成不安全输出,凸显提升LLM鲁棒性的紧迫需求。

关键词

引用

@article{arxiv.2510.06994,
  title  = {RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning},
  author = {Artur Horal and Daniel Pina and Henrique Paz and Iago Paulo and João Soares and Rafael Ferreira and Diogo Tavares and Diogo Glória-Silva and João Magalhães and David Semedo},
  journal= {arXiv preprint arXiv:2510.06994},
  year   = {2025}
}