LLM 自动化红队的提示优化与评估
密码学与安全
2025-07-31 v1 计算与语言
摘要
使用大型语言模型(LLM)的应用正日益普及,使得识别系统漏洞变得越来越重要。自动化红队通过使用 LLM 生成并执行针对目标系统的攻击来加速这一过程。攻击生成器通过攻击成功率(ASR)进行评估,该指标是基于每次攻击成功与否的判断计算出的样本均值。本文引入了一种将 ASR 应用于单次攻击的攻击生成器提示优化方法。通过在随机初始化的目标上多次重复每次攻击,我们测量了攻击的可发现性,即单次攻击成功的期望。该方法揭示了可为提示优化提供依据的可利用模式,最终实现了对生成器更稳健的评估与改进。
引用
@article{arxiv.2507.22133,
title = {Prompt Optimization and Evaluation for LLM Automated Red Teaming},
author = {Michael Freenor and Lauren Alvarez and Milton Leal and Lily Smith and Joel Garrett and Yelyzaveta Husieva and Madeline Woodruff and Ryan Miller and Erich Kummerfeld and Rafael Medeiros and Sander Schulhoff},
journal= {arXiv preprint arXiv:2507.22133},
year = {2025}
}
备注
9 pages, 5 Figures, and 1 Appendix item