RainbowPlus:基于演化质量-多样性搜索增强对抗性提示生成
计算与语言
2026-01-21 v2
摘要
大型语言模型(LLMs)展现出惊人的能力,但容易受到利用漏洞产生不安全或偏见输出的对抗性提示的攻击。现有红队方法常面临可扩展性挑战、资源密集型需求或攻击策略多样性有限的问题。我们提出RainbowPlus,一个基于演化计算的新型红队框架,通过扩展经典演化算法如MAP-Elites的自适应质量-多样性(QD)搜索,增强对抗性提示生成。通过采用多元素档案存储多样化高质量提示,并综合的适应函数同时评估多个提示,RainbowPlus克服了单提示档案和成对比较在先前QD方法(如Rainbow Teaming)中的限制。在与六个基准数据集和四个开源LLMs的实验中,RainbowPlus在攻击成功率(ASR)和多样性(Diverse-Score约0.84)方面均表现优异,生成的唯一提示数量可达常规方法的100倍(例如,10,418 vs. 100)。在针对HarmBench数据集上的九种最新方法中(涉及十个开源和两个封闭源LLMs),RainbowPlus实现平均ASR为81.1%,超越AutoDAN-Turbo 3.9%,且速度快9倍(1.45 vs. 13.50小时)。我们的开源实现促进了LLM安全领域的进一步发展,为进行可扩展的漏洞评估提供了工具。代码和资源已公开于GitHub,支持可重复性研究和LLM红队测试。
引用
@article{arxiv.2504.15047,
title = {RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search},
author = {Quy-Anh Dang and Chris Ngo and Truong-Son Hy},
journal= {arXiv preprint arXiv:2504.15047},
year = {2026}
}