中文

Adversarial Nibbler:一种用于识别文本到图像生成中多种危害的开放红队方法

计算机与社会 2024-05-15 v3 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

随着文本到图像(T2I)生成式 AI 模型走向大众,评估模型对非明显攻击的鲁棒性以减少攻击性图像的生成变得至关重要。通过聚焦“隐式对抗性”提示(即那些因非明显原因触发 T2I 模型生成不安全图像的提示),我们分离出了一组难以解决的安全问题,而人类的创造力非常适合发现这些问题。为此,我们构建了 Adversarial Nibbler 挑战赛,这是一种红队方法,用于众包多样化的隐式对抗性提示。我们组装了一套最先进的 T2I 模型,采用简单的用户界面来识别和标注危害,并吸引不同的人群以捕捉在标准测试中可能被忽视的长尾安全问题。该挑战赛连续分轮进行,以实现对 T2I 模型安全缺陷的持续发现与分析。在本文中,我们深入介绍了我们的方法论,系统研究了新的攻击策略,并讨论了挑战赛参与者所揭示的安全失效问题。我们还发布了一个配套的可视化工具,以便轻松探索数据集并从中获取见解。第一轮挑战赛产生了超过 1 万个带有机器安全标注的提示-图像对。一个包含 1500 个样本的子集包含了丰富的关于危害类型和攻击风格的人工标注。我们发现,人类认为有害的图像中有 14% 被机器错误标记为“安全”。我们识别出了新的攻击策略,突显了确保 T2I 模型鲁棒性的复杂性。我们的研究结果强调了随着新漏洞的出现,持续审计和适应的必要性。我们相信这项工作将实现主动、迭代的安全评估,并促进 T2I 模型的负责任发展。

关键词

引用

@article{arxiv.2403.12075,
  title  = {Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation},
  author = {Jessica Quaye and Alicia Parrish and Oana Inel and Charvi Rastogi and Hannah Rose Kirk and Minsuk Kahng and Erin van Liemt and Max Bartolo and Jess Tsang and Justin White and Nathan Clement and Rafael Mosquera and Juan Ciro and Vijay Janapa Reddi and Lora Aroyo},
  journal= {arXiv preprint arXiv:2403.12075},
  year   = {2024}
}

备注

10 pages, 6 figures