中文

质量-多样性红队测试:用于大型语言模型的高质量和多样攻击者的自动生成

机器学习 2025-06-10 v1 人工智能 神经与进化计算

摘要

确保大型语言模型 (LLM) 的安全性至为重要。红队测试——一种系统性地识别能引发目标 LLM 产生有害响应的对抗性提示的方法——已成为一种至关重要的安全评估方法。在此框架下, 对对抗性提示多样性的追求对于全面性的安全评估至关重要。我们发现,先前的方法在红队测试中可能存在两个关键局限性。首先,它们通常通过简单的度量如词频或句子嵌入相似度来追求多样性,这可能无法捕捉攻击策略的有意义的变异。其次,单一攻击模型训练的常见做法限制了对潜在攻击风格和风险类别的覆盖。本文引入质量-多样性红队测试 (QDRT),一种旨在解决这些局限性的新框架。QDRT 通过行为条件化训练实现目标导向的多样性,并在开放式方式中实现行为回放缓冲区。此外,它训练多个专门的攻击者,能够在多样化的风格和风险类别中生成高质量的攻击。我们的实证评估表明,QDRT 生成的攻击在针对 GPT-2、Llama-3、Gemma-2 和 Qwen2.5 等广泛的目标 LLM 时,既更具多样性又更有效。这一工作推动了 LLM 安全领域的发展,提供了一种系统且有效的自动化红队测试方法,最终支持 LLM 的负责任部署。

关键词

引用

@article{arxiv.2506.07121,
  title  = {Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models},
  author = {Ren-Jian Wang and Ke Xue and Zeyu Qin and Ziniu Li and Sheng Tang and Hao-Tian Li and Shengcai Liu and Chao Qian},
  journal= {arXiv preprint arXiv:2506.07121},
  year   = {2025}
}