中文

从安全基准中提取对抗性提示:Adversarial Nibbler 挑战报告

计算机视觉与模式识别 2023-09-22 v1 人工智能 机器学习

摘要

文本条件图像生成模型近来取得了惊人的图像质量与对齐效果。因此,它们被应用于快速增长的大量场景中。由于这些模型高度数据驱动,依赖从网络随机抓取的十亿规模数据集,它们也会产生不安全内容。作为对 Adversarial Nibbler 挑战的贡献,我们从现有安全基准中提取了超过 1000 条潜在对抗性输入的大型集合。我们对所收集提示及相应图像的分析揭示了输入过滤器的脆弱性,并为当前生成式图像模型中的系统性安全问题提供了进一步见解。

关键词

引用

@article{arxiv.2309.11575,
  title  = {Distilling Adversarial Prompts from Safety Benchmarks: Report for the Adversarial Nibbler Challenge},
  author = {Manuel Brack and Patrick Schramowski and Kristian Kersting},
  journal= {arXiv preprint arXiv:2309.11575},
  year   = {2023}
}