SAGE-RT:用于安全评估与红队测试的人工智能对齐数据生成
人工智能
2024-08-23 v1 计算与语言
密码学与安全
摘要
我们介绍了用于安全评估和红队测试的人工智能对齐数据生成方法(SAGE-RT或SAGE),这是一种新颖的管道,用于生成合成对齐和红队数据。现有方法在创建细致且多样化的数据集方面不足,无法对数据生成和验证过程提供必要的控制,或需要大量手动生成的种子数据。SAGE通过使用详细的分类法,在广泛的主题范围内生成与安全对齐和红队测试相关的数据,解决了上述局限性。我们生成了51,000个多样且深入的提示-响应对,涵盖超过1,500个有害主题,并覆盖大语言模型(LLM)面临的最常见类型越狱提示的各种变体。我们展示,通过SAGE生成的红队数据在超过32个子类别中的27个子类别,以及在超过279个叶子节点类别中超过58个叶子节点类别中成功越狱。对于GPT-4o和GPT-3.5-turbo,在有害性子类别中的攻击成功率为100%。我们的方法通过确保对有害主题进行详细覆盖,使用主题的迭代扩展,并以生成的原始文本为条件来生成输出,从而避免了人工安全训练数据生成中的模式坍缩和缺乏细微差别的生成管道问题。该方法可用于完全合成性地生成红队和对齐数据,以提高大语言模型的安全性,或在多样化主题范围内进行红队测试。
引用
@article{arxiv.2408.11851,
title = {SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming},
author = {Anurakt Kumar and Divyanshu Kumar and Jatan Loya and Nitin Aravind Birur and Tanay Baswa and Sahil Agarwal and Prashanth Harshangi},
journal= {arXiv preprint arXiv:2408.11851},
year = {2024}
}