Ferret: 基于奖励评分技术的更快更有效的自动化红队测试
计算与语言
2024-08-21 v1
摘要
在当今大语言模型(LLMs)被集成到众多现实世界应用的时代,确保其安全性和鲁棒性对于负责任的AI使用至关重要。自动化红队测试方法通过生成对抗攻击来识别和缓解这些模型中的潜在漏洞,发挥着关键作用。然而,现有方法常常面临性能缓慢、类别多样性有限和资源需求高的问题。虽然近期方法Rainbow Teaming通过将对抗提示生成框定为质量-多样性搜索来解决多样性挑战,但其仍然缓慢且需要大型微调变异器才能达到最佳性能。为克服这些限制,我们提出了Ferret,一种在Rainbow Teaming基础上构建的新方法,通过每次迭代生成多个对抗提示变异并使用评分函数对最有效对抗提示进行排序和选择。我们探索了多种评分函数,包括奖励模型、Llama Guard和LLM-as-a-judge,根据其潜在危害程度对对抗变异进行排序,以提高搜索有害变异的效率。我们的结果表明,使用奖励模型作为评分函数的Ferret将总体攻击成功率(ASR)提升至95%,比Rainbow Teaming高出46%。此外,Ferret将达到90% ASR所需的时间相比基线减少了15.2%,并生成了可迁移的对抗提示,即对更大规模的LLM同样有效。我们的代码可在https://github.com/declare-lab/ferret获取。
引用
@article{arxiv.2408.10701,
title = {Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique},
author = {Tej Deep Pala and Vernon Y. H. Toh and Rishabh Bhardwaj and Soujanya Poria},
journal= {arXiv preprint arXiv:2408.10701},
year = {2024}
}