Rainbow Teaming:多样化对抗提示的开放式生成
计算与语言
2024-12-12 v3 人工智能
机器学习
摘要
随着大型语言模型 (LLM) 在众多现实世界应用中日益普及,理解并增强其对抗攻击的鲁棒性至关重要。现有的对抗提示识别方法往往局限于特定领域、缺乏多样性,或需要大量人工标注。为解决这些局限性,我们提出了 Rainbow Teaming,这是一种用于生成多样化对抗提示集合的新型黑盒方法。Rainbow Teaming 将对抗提示生成建模为质量 - 多样性问题,并利用开放式搜索生成既有效又多样的提示。聚焦于安全领域,我们使用 Rainbow Teaming 针对各种最先进的 LLM(包括 Llama 2 和 Llama 3 模型)进行测试。我们的方法揭示了数百个有效的对抗提示,在所有测试模型上的攻击成功率超过 90%。此外,我们证明了由 Rainbow Teaming 生成的提示具有高度可迁移性,且使用该方法生成的合成数据对模型进行微调,能在不牺牲通用性能或有用性的情况下显著提升其安全性。我们还通过将 Rainbow Teaming 应用于问答和网络安全领域,探索了其多功能性,展示了其在推动广泛应用中稳健的开放式自我改进方面的潜力。
引用
@article{arxiv.2402.16822,
title = {Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts},
author = {Mikayel Samvelyan and Sharath Chandra Raparthy and Andrei Lupu and Eric Hambro and Aram H. Markosyan and Manish Bhatt and Yuning Mao and Minqi Jiang and Jack Parker-Holder and Jakob Foerster and Tim Rocktäschel and Roberta Raileanu},
journal= {arXiv preprint arXiv:2402.16822},
year = {2024}
}